Omni ReferenceAlibaba
Wan 3.0 Prime
alibaba/wan-3.0-prime/video
支持多图、视频、音频等多模态参考输入,可生成具有丰富运动表现与真实音画同步效果的视频。精准保持参考素材中的主体外观、动作特征与视觉风格,并支持多种参考组合方式,实现更灵活的内容创作与镜头控制。
示例
参数
| 名称 | 类型 | 默认 | 约束 | 说明 |
|---|---|---|---|---|
| prompt提示词 | textarea | — | ≤ 5000 chars | 最多 5000 字符,中英文各算一个字符。与参考素材必填其一。 |
| images参考图片 | image_upload_group | — | image/jpeg,image/png,image/bmp,image/webp · 0–10 items | 最多 10 张,单张 ≤20MB,单边 240–8000 像素,长宽比不超过 8:1。PNG 不支持透明通道。与首尾帧互斥。 |
| audios参考音频 | audio_upload_group | — | audio/wav,audio/mpeg · 0–5 items | 最多 5 段,单段 1–15 秒,总时长 ≤15 秒,单个 <15MB。支持 WAV、MP3。与首尾帧互斥。 |
| first_frame首帧 | image_upload | — | image/jpeg,image/png,image/bmp,image/webp | 严格指定视频第一帧。与参考图片/视频/音频互斥。 |
| last_frame尾帧 | image_upload | — | image/jpeg,image/png,image/bmp,image/webp | 严格指定视频最后一帧。与参考图片/视频/音频互斥。 |
| resolution分辨率 | select | 1080P | 480P | 720P | 1080P | |
| aspect_ratio长宽比 | select | adaptive | adaptive | 16:9 | 4:3 | 1:1 | 3:4 | 9:16 | 自适应会根据意图和输入媒体比例自动选择。 |
| duration生成时长(秒) | number | 5 | -1 ~ 30 · step 1 | 2–30 秒;填 -1 为智能时长,由模型自动决定。有视频输入时,输入与输出总时长不超过 30 秒。智能时长按 30 秒预扣费。 |
| generate_audio生成音轨 | boolean | true | — | 关闭后输出视频不含音轨。开关音轨价格相同。 |
| enable_thinking深度思考模式 | boolean | false | — | 解析文档、网页、复杂图像内容时需要开启。不输入文档或链接时不建议开启。 |
| file参考文档 | file_upload | — | .docx,.doc,.xlsx,.xls,.pptx,.ppt,.pdf,.txt,.key,.pages,.numbers,.md · 0–1 items | 最多 1 个,≤100MB,≤50 页。需开启深度思考模式,且与网页链接互斥。 |
| link参考网页 | text | — | — | 仅支持无需登录的公开网页。国内不解析海外 URL。需开启深度思考模式,且与参考文档互斥。 |
| seed随机种子 | number | — | 0 ~ 2147483647 · step 1 |
API
通过统一 REST API 调用本模型;在 API Keys 页获取密钥。
cURL
# 1) Submit — returns { "task_uuid": "..." }
curl -X POST "https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-3.0-prime/video" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"input": {
"resolution": "1080P",
"aspect_ratio": "adaptive",
"duration": 5,
"generate_audio": true,
"enable_thinking": false
}
}'
# 2) Poll until status is "completed", then read the output URLs
curl "https://www.namifusion.com/api/v1/marketplace/run/tasks/TASK_UUID" \
-H "Authorization: Bearer YOUR_API_KEY"Python
import time, requests
API_KEY = "YOUR_API_KEY"
HEADERS = {"Authorization": f"Bearer {API_KEY}"}
# 1) Submit
resp = requests.post(
"https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-3.0-prime/video",
headers=HEADERS,
json={
"input": {
"resolution": "1080P",
"aspect_ratio": "adaptive",
"duration": 5,
"generate_audio": True,
"enable_thinking": False
}
},
)
resp.raise_for_status() # 401/402/429/5xx stop here instead of polling a bad task
task = resp.json()
# 2) Poll until a terminal state (completed / failed / cancelled).
# This model is allowed up to 300s server-side.
deadline = time.time() + 360
while task.get("status") not in ("completed", "failed", "cancelled"):
if time.time() > deadline:
raise TimeoutError(f"still {task.get('status')} — keep the task_uuid and poll later")
time.sleep(3)
poll = requests.get(f"https://www.namifusion.com/api/v1/marketplace/run/tasks/{task['task_uuid']}", headers=HEADERS)
poll.raise_for_status()
task = poll.json()
print(task["status"], task.get("output"))JavaScript
const API_KEY = "YOUR_API_KEY";
const HEADERS = { Authorization: `Bearer ${API_KEY}` };
// 1) Submit
const resp = await fetch("https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-3.0-prime/video", {
method: "POST",
headers: { ...HEADERS, "Content-Type": "application/json" },
body: JSON.stringify({
"input": {
"resolution": "1080P",
"aspect_ratio": "adaptive",
"duration": 5,
"generate_audio": true,
"enable_thinking": false
}
}),
});
if (!resp.ok) throw new Error(`submit failed: ${resp.status} ${await resp.text()}`);
let task = await resp.json();
// 2) Poll until a terminal state (completed / failed / cancelled).
// This model is allowed up to 300s server-side.
const deadline = Date.now() + 360 * 1000;
while (!["completed", "failed", "cancelled"].includes(task.status)) {
if (Date.now() > deadline) throw new Error(`still ${task.status} — keep the task_uuid and poll later`);
await new Promise((r) => setTimeout(r, 3000));
const poll = await fetch(`https://www.namifusion.com/api/v1/marketplace/run/tasks/${task.task_uuid}`, { headers: HEADERS });
if (!poll.ok) throw new Error(`poll failed: ${poll.status}`);
task = await poll.json();
}
console.log(task.status, task.output);文档
Wan 3.0 Prime 视频生成
一个模型接住全部输入——文本、图片、视频、音频、文档,单次生成最长 30 秒。
Wan 3.0 视频生成是一款 all in one 的视频生成模型,在生成时长、万能创作、全能参考与真实感等维度全面升级。单次可生成 30 秒视频,完整表达创作意图——时长的延展不只是参数上的提升,更带来更大的创作自由度,让叙事节奏更游刃有余,连续运镜、一镜到底等复杂镜头语言得以充分表达,从"生成一个镜头"走向"讲述一段完整的故事"。在文本、图片、音频、视频四种基础模态之外,首次支持 doc、xls、ppt、pdf、md 等文档格式输入,让"万物皆可生视频"。
🚀 核心特性
- 原生 30 秒时长生成:从一个镜头走向一段完整故事。支持智能时长,可根据提示词自动推荐合适时长。
- 六模态全能参考:图片、视频、音频、文档、网页可在单次请求中组合使用,由提示词统一调度。
- 办公素材直接转视频:支持 doc、xls、ppt、pdf、txt、key、pages、numbers、md,搭配提示词即可生成教学课件、产品演示、动态图表、业务汇报。
- 超写实世界渲染器:人像力求"千人千面",更敏锐地刻画五官与皮肤细节,情绪表达自然克制,微表情与肢体动作彼此联动;即便群像场景也能细腻呈现不同人物的复杂情绪。
- 像素级一致性保持:角色、道具、声音、空间关系均可稳定对齐参考素材,不仅是"差不多像",更是"像素级还原"。
- 严格首尾帧模式:需要精确控制起止画面时,可指定首帧与尾帧。
- 原生音轨输出:生成的视频自带音轨,开关声音价格相同。
- 自适应长宽比:可由模型根据意图与输入媒体比例自动选择,也可从 5 种预设中指定。
🛠️ 技术规格
| 项目 | 说明 |
|---|---|
| 模型架构 | all in one 全能参考视频生成模型 |
| 任务类型 | 视频生成(文本 / 图片 / 视频 / 音频 / 文档生视频) |
| 提示词 | 支持中英文,最长 5000 字符。与参考素材必填其一 |
| 输出 | 带音轨的视频 |
| 分辨率 | 480P、720P、1080P(默认 1080P) |
| 生成时长 | 2–30 秒(默认 5);填 -1 为智能时长。有视频输入时,输入与输出总时长不超过 30 秒 |
| 长宽比 | adaptive(默认)、16:9、4:3、1:1、3:4、9:16 |
| 参考图片 | 最多 10 张;JPEG、JPG、PNG(不支持透明通道)、BMP、WEBP;单张 ≤20MB;单边 240–8000 像素;长宽比不超过 8:1 |
| 参考视频 | 最多 5 段,单段 1–15 秒、总时长 ≤15 秒;mp4、mov;单个 <100MB;单边 240–4096 像素 |
| 参考音频 | 最多 5 段,单段 1–15 秒、总时长 ≤15 秒;wav、mp3;单个 <15MB |
| 文档输入 | 最多 1 个,≤100MB,≤50 页;docx、doc、xlsx、xls、pptx、ppt、pdf、txt、key、pages、numbers、md。需开启深度思考模式 |
| 网页输入 | 最多 1 个公开网页,无需登录。需开启深度思考模式,与文档互斥 |
| 首帧 / 尾帧 | 各最多 1 张;与全能参考类输入互斥 |
| 深度思考模式 | 默认关闭;解析文档、网页、复杂图像内容时需开启 |
| 随机种子 | 可选;0–2147483647 用于结果复现 |
| 声音开关 | 默认打开;开关声音价格相同 |
| 延迟 | 无冷启动 |
示例提示词
视频1抱着图3,在图4的椅子上弹奏一支舒缓的乡村民谣,并说道:"今天的阳光真好。"图1手中拿着图2,路过视频1,把手中的图2放到视频1旁边的桌子上,并说道:"真好听,能不能再唱一遍"。一段 30 秒的电影感一镜到底,夜晚雨后的霓虹街道,镜头持续向前推进,掠过招牌与地面反光,环境音包含远处车流。把附件中的产品资料转成动态讲解视频:关键数据以屏幕图表形式逐条呈现,保持品牌配色,旁白节奏平稳。
💰 价格
按视频秒数计费,输入视频和输出视频均计费。
计费时长 = 输入视频时长 + 输出视频时长
| 分辨率 | 每秒价格 |
|---|---|
| 480P | $0.0625 |
| 720P | $0.125 |
| 1080P | $0.25 |
费用示例
| 场景 | 计费时长 | 480P | 720P | 1080P |
|---|---|---|---|---|
| 输出 10 秒,无参考视频 | 10 秒 | $0.625 | $1.25 | $2.50 |
| 输出 15 秒 + 参考视频 5 秒 | 20 秒 | $1.25 | $2.50 | $5.00 |
| 输出 30 秒,无参考视频 | 30 秒 | $1.875 | $3.75 | $7.50 |
计费规则
- 输入视频和输出视频均计费,按视频秒数计算。
- 输入视频的计费时长为实际输入的视频秒数,输出视频为成功生成的视频秒数。
- 参考图片与参考音频不按时长计费。
- 开关音轨不影响价格。
- 失败不计费,全额退款。
- 智能时长(
-1)按 30 秒上限预扣费,任务完成后按实际生成时长结算多退少补。
💡 最佳使用场景
- 完整短片叙事:30 秒连续视频,为叙事节奏、连续运镜、一镜到底留出空间。
- 办公素材转视频:将 PPT、表格、PDF 转成教学课件、产品演示、动态图表与业务汇报。
- 角色与风格一致性:通过多模态参考,让人物、服饰、道具、声音在系列化内容中保持稳定。
- 电商与广告创意:单次请求融合商品图、品牌视觉与参考视频,产出投放素材。
- 精确控制的转场:需要起止画面严格一致时,使用首尾帧模式。
🔗 相关模型
- Wan 2.7 图生视频:只需让单张参考图动起来时,更轻量的选择。
- Wan 2.7 文生视频:纯提示词生成短片的场景更适合。