如何使用 ai/heartmula/transcribe-lyrics 音频歌词转写 API:speech to text接入指南(2026)

2 min · 更新于 2026-07-11 · NamiFusion 团队

ai/heartmula/transcribe-lyrics 音频歌词转写 API 接入教程:参数说明、价格与可直接运行的调用代码,先在 Playground 试玩再一行代码接入。

ai/heartmula/transcribe-lyrics 音频歌词转写 是一款speech to text模型(由 Heartmula 提供):HeartMuLa Transcribe 使用先进的 AI 从音频文件中提取歌词,支持多语言转写。提供开箱即用的 REST 推理 API,性能出色、无冷启动,价格实惠。在 NamiFusion 上可以在 Playground 直接试玩(提交前显示准确报价),再通过统一 REST API 一行代码接入,典型一次调用约 $0.050。

TL;DR

· 任务类型:speech to text,由 Heartmula 提供

· 价格:典型一次调用约 $0.050($1 = 100 积分),按量计费无订阅

· 上手路径:Playground 试玩(提交前显示报价)→ API Keys 建密钥 → 一个 POST 接入

· 可调参数:1 个(见下方参数表)

· 无平台水印,商用可用(遵守服务条款)

用 ai/heartmula/transcribe-lyrics 音频歌词转写 能做什么?

视频配音与旁白:为短视频、课程、广告快速生成多语言人声。

有声内容生产:把文章、新闻、小说批量转成可发布的音频。

产品语音界面:为应用和智能硬件生成一致的品牌语音。

怎么调用这个 API?

  1. 在 NamiFusion 注册并在 API Keys 页面创建密钥(注册赠送积分仅可用于指定模型)。
  2. 用下面的 cURL 示例提交任务,Header 带上 Bearer 密钥。
  3. 用返回的 task_uuid 轮询任务状态,完成后取输出 URL。
提交任务
# 1) Submit — returns { "task_uuid": "..." }
curl -X POST "https://www.namifusion.com/api/v1/marketplace/run/heartmula/transcribe-lyrics" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "input": {
    "audio": "https://d5v2vcqcwe9y5.cloudfront.net/algorithm/video_translate/260327/default/qtqfcgymg08o.wav"
  }
}'

# 2) Poll until status is "completed", then read the output URLs
curl "https://www.namifusion.com/api/v1/marketplace/run/tasks/TASK_UUID" \
  -H "Authorization: Bearer YOUR_API_KEY"

有哪些参数?

audio(音频):必填

价格是多少?

按次积分计价,典型一次调用约 $0.050($1 = 100 积分),实际价格随参数(分辨率/时长等)变化,Playground 里提交前会显示准确报价。

ai/heartmula/transcribe-lyrics 音频歌词转写

高性价比的多语言歌词转写模型,支持即开即用、无冷启动。

ai/heartmula/transcribe-lyrics 是一款专注于从音频中提取歌词内容的 AI 模型,适用于歌曲转写、歌词整理与多语言音频内容处理。该模型强调稳定性能、无冷启动体验与较低使用成本,适合需要快速批量处理音频歌词的开发者与内容平台。

🚀 关键特性

  • 歌词转写优化:专为音频中的歌词提取设计,相比通用语音转写流程更适合音乐内容场景。
  • 支持多语言:可用于多语言歌曲与跨语种音频内容的歌词识别与整理。
  • 无冷启动:提供更稳定的在线推理体验,适合对响应一致性有要求的生产环境。
  • 即开即用:输入音频 URL 即可发起处理,便于快速接入现有内容工作流。
  • 高性价比:以较低单次成本支持歌词提取任务,适合批量处理与平台化部署。

🛠️ 技术规格

项目说明
模型架构AI 歌词转写模型
任务类型音频转文本(歌词提取)
输入音频 URL
输入格式字符串(audio)
输出歌词文本
音频支持多语言音频
延迟在线推理优化,支持无冷启动体验
部署特性面向生产环境的稳定性能

示例提示词

注:该模型主要接收音频输入,不依赖提示词进行控制。以下示例展示的是典型任务描述方式,便于理解使用场景。

  • 提取这段歌曲音频中的完整歌词内容。
  • 将该多语言歌曲中的歌词按原始语言转写输出。
  • 识别音频中的演唱内容,并整理为可读歌词文本。

💰 价格

计费项价格
基础价格$0.05

常见问题

可以先免费试用吗?+

注册赠送积分仅可用于指定模型,适用范围会持续更新;Playground 提交前会显示准确报价。

生成内容可以商用吗?有水印吗?+

可以商用,NamiFusion 不给生成结果加平台水印;使用须遵守服务条款与适用法律。

内容政策是什么?+

色情内容、涉及未成年人的性化内容、未经授权使用真人、欺骗性冒充、诈骗与虚假代言均禁止。合法、自愿且非露骨的成年人主题可能被允许,详见服务条款。

ai/heartmula/transcribe-lyrics 音频歌词转写 的任务要跑多久?+

取决于参数,图像通常数秒到数十秒,视频通常数十秒到几分钟;API 返回 task_uuid 供轮询。

分辨率/时长上限是多少?+

以模型参数表为准:每个模型的可选分辨率、时长档位都在上方参数说明与 Playground 中列出。