ai/heartmula/transcribe-lyrics 音声歌詞文字起こし API の使い方:speech to text統合ガイド(2026)

2 min · 更新 2026-07-11 · NamiFusion チーム

NamiFusion で ai/heartmula/transcribe-lyrics 音声歌詞文字起こし API を呼び出す方法:パラメータ、料金、そのまま実行できるコード例、Playground で試用可能。

ai/heartmula/transcribe-lyrics 音声歌詞文字起こし は Heartmula のspeech to textモデルです:HeartMuLa Transcribe は高度な AI を使用して音声ファイルから歌詞を抽出します。多言語の文字起こしに対応。すぐに使える REST 推論 API を提供し、高性能・コールドスタートなし・手頃な価格で利用できます。NamiFusion では Playground で試してから(送信前に見積もり表示)、統一 REST API で呼び出せます(1 回あたり約 $0.050)。

TL;DR

· タスク種別:speech to text(提供:Heartmula)

· 料金:1 回あたり約 $0.050($1 = 100 クレジット)、従量課金

· 始め方:Playground で試用(送信前に見積もり)→ API キー作成 → POST 一発で統合

· 調整可能パラメータ:1 個(下表参照)

· プラットフォーム透かしなし。商用利用可(利用規約に従う)

ai/heartmula/transcribe-lyrics 音声歌詞文字起こし で何が作れる?

動画のナレーション:ショート動画・講座・広告向けに多言語音声を高速生成。

オーディオコンテンツ制作:記事やニュース、小説を一括で音声化。

製品の音声インターフェース:アプリやデバイスに一貫したブランドボイスを。

この API はどう呼び出す?

  1. NamiFusion に登録し、API Keys ページでキーを作成(登録特典クレジットは指定モデルのみ対象)。
  2. 下記の cURL 例でタスクを送信。Bearer トークンにキーを指定。
  3. 返された task_uuid でステータスをポーリングし、完了後に出力 URL を取得。
タスクを送信
# 1) Submit — returns { "task_uuid": "..." }
curl -X POST "https://www.namifusion.com/api/v1/marketplace/run/heartmula/transcribe-lyrics" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "input": {
    "audio": "https://d5v2vcqcwe9y5.cloudfront.net/algorithm/video_translate/260327/default/qtqfcgymg08o.wav"
  }
}'

# 2) Poll until status is "completed", then read the output URLs
curl "https://www.namifusion.com/api/v1/marketplace/run/tasks/TASK_UUID" \
  -H "Authorization: Bearer YOUR_API_KEY"

どんなパラメータがある?

audio(音声):必須

料金はいくら?

従量課金(クレジット制)。1 回あたり約 $0.050($1 = 100 クレジット)。解像度や長さなどで変動し、Playground では送信前に正確な見積もりが表示されます。

ai/heartmula/transcribe-lyrics 音声歌詞文字起こし

多言語の歌詞を高速に文字起こしできる、低コストかつコールドスタートなしのモデルです。

ai/heartmula/transcribe-lyrics は、音声ファイルから歌詞を抽出するために設計された AI モデルです。多言語の文字起こしに対応しており、安定した推論性能、コールドスタートなしの応答性、導入しやすい価格設定により、本番用途の歌詞抽出ワークフローに適しています。

🚀 主な特長

  • 歌詞抽出に特化:一般的な音声文字起こしではなく、楽曲内の歌詞抽出ユースケースに適した設計です。
  • 多言語対応:多言語の楽曲や国際向けコンテンツの歌詞文字起こしに対応します。
  • コールドスタートなし:安定した応答性能により、継続的な運用や高頻度処理にも適しています。
  • シンプルな入力方式:音声 URL を指定するだけで処理でき、既存のメディア処理基盤に組み込みやすい構成です。
  • 優れたコスト効率:低い実行単価により、大量処理やカタログ整備にも導入しやすくなっています。

🛠️ 技術仕様

項目内容
モデルアーキテクチャAI 歌詞文字起こしモデル
タスク種別音声からテキストへの変換(歌詞抽出)
入力音声 URL
入力形式文字列(audio)
出力文字起こしされた歌詞テキスト
対応言語多言語
レイテンシオンライン推論向けに最適化、コールドスタートなし
運用特性本番利用向けの安定した性能

サンプルプロンプト

注:このモデルは主に音声入力を用いて動作し、プロンプトによる制御を前提としていません。以下は代表的な利用意図の例です。

  • この楽曲音声から完全な歌詞を抽出してください。
  • この多言語の楽曲から歌詞を文字起こししてください。
  • この音声ファイル内の歌唱内容を識別し、読みやすい歌詞テキストとして出力してください。

💰 価格

項目価格
基本料金$0.05

よくある質問

無料で試せますか?+

登録特典クレジットは指定モデルでのみ利用でき、対象範囲は随時更新されます。Playground では送信前に正確な見積もりを確認できます。

生成物は商用利用できますか?ウォーターマークは?+

商用利用できます。NamiFusion はプラットフォームのウォーターマークを付けません。利用規約と適用法に従ってください。

コンテンツポリシーは?+

ポルノコンテンツ、未成年者を性的に扱うコンテンツ、許可のない実在人物の利用、欺瞞的ななりすまし、詐欺、虚偽の推薦は禁止です。合法で、成人全員の同意があり、露骨でないテーマは認められる場合があります。詳しくは利用規約をご覧ください。

ai/heartmula/transcribe-lyrics 音声歌詞文字起こし のタスクはどれくらいかかる?+

パラメータ次第で、画像は数秒〜数十秒、動画は数十秒〜数分。API は task_uuid を返すのでポーリングできます。

解像度・長さの上限は?+

上のパラメータ表を参照してください。各モデルの解像度・長さの選択肢はパラメータ説明と Playground に記載されています。