如何使用 ai/heartmula/transcribe-lyrics 音频歌词转写 API:speech to text接入指南(2026)
ai/heartmula/transcribe-lyrics 音频歌词转写 API 接入教程:参数说明、价格与可直接运行的调用代码,先在 Playground 试玩再一行代码接入。
ai/heartmula/transcribe-lyrics 音频歌词转写 是一款speech to text模型(由 Heartmula 提供):HeartMuLa Transcribe 使用先进的 AI 从音频文件中提取歌词,支持多语言转写。提供开箱即用的 REST 推理 API,性能出色、无冷启动,价格实惠。在 NamiFusion 上可以在 Playground 直接试玩(提交前显示准确报价),再通过统一 REST API 一行代码接入,典型一次调用约 $0.050。
TL;DR
· 任务类型:speech to text,由 Heartmula 提供
· 价格:典型一次调用约 $0.050($1 = 100 积分),按量计费无订阅
· 上手路径:Playground 试玩(提交前显示报价)→ API Keys 建密钥 → 一个 POST 接入
· 可调参数:1 个(见下方参数表)
· 无平台水印,商用可用(遵守服务条款)
用 ai/heartmula/transcribe-lyrics 音频歌词转写 能做什么?
视频配音与旁白:为短视频、课程、广告快速生成多语言人声。
有声内容生产:把文章、新闻、小说批量转成可发布的音频。
产品语音界面:为应用和智能硬件生成一致的品牌语音。
怎么调用这个 API?
- 在 NamiFusion 注册并在 API Keys 页面创建密钥(注册赠送积分仅可用于指定模型)。
- 用下面的 cURL 示例提交任务,Header 带上 Bearer 密钥。
- 用返回的 task_uuid 轮询任务状态,完成后取输出 URL。
# 1) Submit — returns { "task_uuid": "..." }
curl -X POST "https://www.namifusion.com/api/v1/marketplace/run/heartmula/transcribe-lyrics" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"input": {
"audio": "https://d5v2vcqcwe9y5.cloudfront.net/algorithm/video_translate/260327/default/qtqfcgymg08o.wav"
}
}'
# 2) Poll until status is "completed", then read the output URLs
curl "https://www.namifusion.com/api/v1/marketplace/run/tasks/TASK_UUID" \
-H "Authorization: Bearer YOUR_API_KEY"有哪些参数?
audio(音频):必填
价格是多少?
按次积分计价,典型一次调用约 $0.050($1 = 100 积分),实际价格随参数(分辨率/时长等)变化,Playground 里提交前会显示准确报价。
ai/heartmula/transcribe-lyrics 音频歌词转写
高性价比的多语言歌词转写模型,支持即开即用、无冷启动。
ai/heartmula/transcribe-lyrics 是一款专注于从音频中提取歌词内容的 AI 模型,适用于歌曲转写、歌词整理与多语言音频内容处理。该模型强调稳定性能、无冷启动体验与较低使用成本,适合需要快速批量处理音频歌词的开发者与内容平台。
🚀 关键特性
- 歌词转写优化:专为音频中的歌词提取设计,相比通用语音转写流程更适合音乐内容场景。
- 支持多语言:可用于多语言歌曲与跨语种音频内容的歌词识别与整理。
- 无冷启动:提供更稳定的在线推理体验,适合对响应一致性有要求的生产环境。
- 即开即用:输入音频 URL 即可发起处理,便于快速接入现有内容工作流。
- 高性价比:以较低单次成本支持歌词提取任务,适合批量处理与平台化部署。
🛠️ 技术规格
| 项目 | 说明 |
|---|---|
| 模型架构 | AI 歌词转写模型 |
| 任务类型 | 音频转文本(歌词提取) |
| 输入 | 音频 URL |
| 输入格式 | 字符串(audio) |
| 输出 | 歌词文本 |
| 音频支持 | 多语言音频 |
| 延迟 | 在线推理优化,支持无冷启动体验 |
| 部署特性 | 面向生产环境的稳定性能 |
示例提示词
注:该模型主要接收音频输入,不依赖提示词进行控制。以下示例展示的是典型任务描述方式,便于理解使用场景。
- 提取这段歌曲音频中的完整歌词内容。
- 将该多语言歌曲中的歌词按原始语言转写输出。
- 识别音频中的演唱内容,并整理为可读歌词文本。
💰 价格
| 计费项 | 价格 |
|---|---|
| 基础价格 | $0.05 |
常见问题
可以先免费试用吗?+
注册赠送积分仅可用于指定模型,适用范围会持续更新;Playground 提交前会显示准确报价。
生成内容可以商用吗?有水印吗?+
可以商用,NamiFusion 不给生成结果加平台水印;使用须遵守服务条款与适用法律。
内容政策是什么?+
色情内容、涉及未成年人的性化内容、未经授权使用真人、欺骗性冒充、诈骗与虚假代言均禁止。合法、自愿且非露骨的成年人主题可能被允许,详见服务条款。
ai/heartmula/transcribe-lyrics 音频歌词转写 的任务要跑多久?+
取决于参数,图像通常数秒到数十秒,视频通常数十秒到几分钟;API 返回 task_uuid 供轮询。
分辨率/时长上限是多少?+
以模型参数表为准:每个模型的可选分辨率、时长档位都在上方参数说明与 Playground 中列出。