Omni ReferenceAlibaba

Wan 3.0 Prime

alibaba/wan-3.0-prime/video

支持多图、视频、音频等多模态参考输入,可生成具有丰富运动表现与真实音画同步效果的视频。精准保持参考素材中的主体外观、动作特征与视觉风格,并支持多种参考组合方式,实现更灵活的内容创作与镜头控制。

示例

Wan 3.0 Prime example 1

参数

名称类型默认约束说明
prompt提示词textarea≤ 5000 chars最多 5000 字符,中英文各算一个字符。与参考素材必填其一。
images参考图片image_upload_groupimage/jpeg,image/png,image/bmp,image/webp · 0–10 items最多 10 张,单张 ≤20MB,单边 240–8000 像素,长宽比不超过 8:1。PNG 不支持透明通道。与首尾帧互斥。
audios参考音频audio_upload_groupaudio/wav,audio/mpeg · 0–5 items最多 5 段,单段 1–15 秒,总时长 ≤15 秒,单个 <15MB。支持 WAV、MP3。与首尾帧互斥。
first_frame首帧image_uploadimage/jpeg,image/png,image/bmp,image/webp严格指定视频第一帧。与参考图片/视频/音频互斥。
last_frame尾帧image_uploadimage/jpeg,image/png,image/bmp,image/webp严格指定视频最后一帧。与参考图片/视频/音频互斥。
resolution分辨率select1080P480P | 720P | 1080P
aspect_ratio长宽比selectadaptiveadaptive | 16:9 | 4:3 | 1:1 | 3:4 | 9:16自适应会根据意图和输入媒体比例自动选择。
duration生成时长(秒)number5-1 ~ 30 · step 12–30 秒;填 -1 为智能时长,由模型自动决定。有视频输入时,输入与输出总时长不超过 30 秒。智能时长按 30 秒预扣费。
generate_audio生成音轨booleantrue关闭后输出视频不含音轨。开关音轨价格相同。
enable_thinking深度思考模式booleanfalse解析文档、网页、复杂图像内容时需要开启。不输入文档或链接时不建议开启。
file参考文档file_upload.docx,.doc,.xlsx,.xls,.pptx,.ppt,.pdf,.txt,.key,.pages,.numbers,.md · 0–1 items最多 1 个,≤100MB,≤50 页。需开启深度思考模式,且与网页链接互斥。
link参考网页text仅支持无需登录的公开网页。国内不解析海外 URL。需开启深度思考模式,且与参考文档互斥。
seed随机种子number0 ~ 2147483647 · step 1

API

通过统一 REST API 调用本模型;在 API Keys 页获取密钥。

cURL
# 1) Submit — returns { "task_uuid": "..." }
curl -X POST "https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-3.0-prime/video" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "input": {
    "resolution": "1080P",
    "aspect_ratio": "adaptive",
    "duration": 5,
    "generate_audio": true,
    "enable_thinking": false
  }
}'

# 2) Poll until status is "completed", then read the output URLs
curl "https://www.namifusion.com/api/v1/marketplace/run/tasks/TASK_UUID" \
  -H "Authorization: Bearer YOUR_API_KEY"
Python
import time, requests

API_KEY = "YOUR_API_KEY"
HEADERS = {"Authorization": f"Bearer {API_KEY}"}

# 1) Submit
resp = requests.post(
    "https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-3.0-prime/video",
    headers=HEADERS,
    json={
        "input": {
            "resolution": "1080P",
            "aspect_ratio": "adaptive",
            "duration": 5,
            "generate_audio": True,
            "enable_thinking": False
        }
    },
)
resp.raise_for_status()  # 401/402/429/5xx stop here instead of polling a bad task
task = resp.json()

# 2) Poll until a terminal state (completed / failed / cancelled).
#    This model is allowed up to 300s server-side.
deadline = time.time() + 360
while task.get("status") not in ("completed", "failed", "cancelled"):
    if time.time() > deadline:
        raise TimeoutError(f"still {task.get('status')} — keep the task_uuid and poll later")
    time.sleep(3)
    poll = requests.get(f"https://www.namifusion.com/api/v1/marketplace/run/tasks/{task['task_uuid']}", headers=HEADERS)
    poll.raise_for_status()
    task = poll.json()

print(task["status"], task.get("output"))
JavaScript
const API_KEY = "YOUR_API_KEY";
const HEADERS = { Authorization: `Bearer ${API_KEY}` };

// 1) Submit
const resp = await fetch("https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-3.0-prime/video", {
  method: "POST",
  headers: { ...HEADERS, "Content-Type": "application/json" },
  body: JSON.stringify({
    "input": {
      "resolution": "1080P",
      "aspect_ratio": "adaptive",
      "duration": 5,
      "generate_audio": true,
      "enable_thinking": false
    }
  }),
});
if (!resp.ok) throw new Error(`submit failed: ${resp.status} ${await resp.text()}`);
let task = await resp.json();

// 2) Poll until a terminal state (completed / failed / cancelled).
//    This model is allowed up to 300s server-side.
const deadline = Date.now() + 360 * 1000;
while (!["completed", "failed", "cancelled"].includes(task.status)) {
  if (Date.now() > deadline) throw new Error(`still ${task.status} — keep the task_uuid and poll later`);
  await new Promise((r) => setTimeout(r, 3000));
  const poll = await fetch(`https://www.namifusion.com/api/v1/marketplace/run/tasks/${task.task_uuid}`, { headers: HEADERS });
  if (!poll.ok) throw new Error(`poll failed: ${poll.status}`);
  task = await poll.json();
}

console.log(task.status, task.output);

文档

Wan 3.0 Prime 视频生成

一个模型接住全部输入——文本、图片、视频、音频、文档,单次生成最长 30 秒。

Wan 3.0 视频生成是一款 all in one 的视频生成模型,在生成时长、万能创作、全能参考与真实感等维度全面升级。单次可生成 30 秒视频,完整表达创作意图——时长的延展不只是参数上的提升,更带来更大的创作自由度,让叙事节奏更游刃有余,连续运镜、一镜到底等复杂镜头语言得以充分表达,从"生成一个镜头"走向"讲述一段完整的故事"。在文本、图片、音频、视频四种基础模态之外,首次支持 doc、xls、ppt、pdf、md 等文档格式输入,让"万物皆可生视频"。

🚀 核心特性

  • 原生 30 秒时长生成:从一个镜头走向一段完整故事。支持智能时长,可根据提示词自动推荐合适时长。
  • 六模态全能参考:图片、视频、音频、文档、网页可在单次请求中组合使用,由提示词统一调度。
  • 办公素材直接转视频:支持 doc、xls、ppt、pdf、txt、key、pages、numbers、md,搭配提示词即可生成教学课件、产品演示、动态图表、业务汇报。
  • 超写实世界渲染器:人像力求"千人千面",更敏锐地刻画五官与皮肤细节,情绪表达自然克制,微表情与肢体动作彼此联动;即便群像场景也能细腻呈现不同人物的复杂情绪。
  • 像素级一致性保持:角色、道具、声音、空间关系均可稳定对齐参考素材,不仅是"差不多像",更是"像素级还原"。
  • 严格首尾帧模式:需要精确控制起止画面时,可指定首帧与尾帧。
  • 原生音轨输出:生成的视频自带音轨,开关声音价格相同。
  • 自适应长宽比:可由模型根据意图与输入媒体比例自动选择,也可从 5 种预设中指定。

🛠️ 技术规格

项目说明
模型架构all in one 全能参考视频生成模型
任务类型视频生成(文本 / 图片 / 视频 / 音频 / 文档生视频)
提示词支持中英文,最长 5000 字符。与参考素材必填其一
输出带音轨的视频
分辨率480P、720P、1080P(默认 1080P)
生成时长2–30 秒(默认 5);填 -1 为智能时长。有视频输入时,输入与输出总时长不超过 30 秒
长宽比adaptive(默认)、16:9、4:3、1:1、3:4、9:16
参考图片最多 10 张;JPEG、JPG、PNG(不支持透明通道)、BMP、WEBP;单张 ≤20MB;单边 240–8000 像素;长宽比不超过 8:1
参考视频最多 5 段,单段 1–15 秒、总时长 ≤15 秒;mp4、mov;单个 <100MB;单边 240–4096 像素
参考音频最多 5 段,单段 1–15 秒、总时长 ≤15 秒;wav、mp3;单个 <15MB
文档输入最多 1 个,≤100MB,≤50 页;docx、doc、xlsx、xls、pptx、ppt、pdf、txt、key、pages、numbers、md。需开启深度思考模式
网页输入最多 1 个公开网页,无需登录。需开启深度思考模式,与文档互斥
首帧 / 尾帧各最多 1 张;与全能参考类输入互斥
深度思考模式默认关闭;解析文档、网页、复杂图像内容时需开启
随机种子可选;0–2147483647 用于结果复现
声音开关默认打开;开关声音价格相同
延迟无冷启动

示例提示词

  • 视频1抱着图3,在图4的椅子上弹奏一支舒缓的乡村民谣,并说道:"今天的阳光真好。"图1手中拿着图2,路过视频1,把手中的图2放到视频1旁边的桌子上,并说道:"真好听,能不能再唱一遍"。
  • 一段 30 秒的电影感一镜到底,夜晚雨后的霓虹街道,镜头持续向前推进,掠过招牌与地面反光,环境音包含远处车流。
  • 把附件中的产品资料转成动态讲解视频:关键数据以屏幕图表形式逐条呈现,保持品牌配色,旁白节奏平稳。

💰 价格

视频秒数计费,输入视频和输出视频均计费

计费时长 = 输入视频时长 + 输出视频时长

分辨率每秒价格
480P$0.0625
720P$0.125
1080P$0.25

费用示例

场景计费时长480P720P1080P
输出 10 秒,无参考视频10 秒$0.625$1.25$2.50
输出 15 秒 + 参考视频 5 秒20 秒$1.25$2.50$5.00
输出 30 秒,无参考视频30 秒$1.875$3.75$7.50

计费规则

  • 输入视频和输出视频均计费,按视频秒数计算。
  • 输入视频的计费时长为实际输入的视频秒数,输出视频为成功生成的视频秒数
  • 参考图片与参考音频不按时长计费
  • 开关音轨不影响价格
  • 失败不计费,全额退款。
  • 智能时长(-1)按 30 秒上限预扣费,任务完成后按实际生成时长结算多退少补。

💡 最佳使用场景

  • 完整短片叙事:30 秒连续视频,为叙事节奏、连续运镜、一镜到底留出空间。
  • 办公素材转视频:将 PPT、表格、PDF 转成教学课件、产品演示、动态图表与业务汇报。
  • 角色与风格一致性:通过多模态参考,让人物、服饰、道具、声音在系列化内容中保持稳定。
  • 电商与广告创意:单次请求融合商品图、品牌视觉与参考视频,产出投放素材。
  • 精确控制的转场:需要起止画面严格一致时,使用首尾帧模式。

🔗 相关模型

  • Wan 2.7 图生视频:只需让单张参考图动起来时,更轻量的选择。
  • Wan 2.7 文生视频:纯提示词生成短片的场景更适合。