Omni ReferenceAlibaba

Wan 3.0 Prime

alibaba/wan-3.0-prime/video

複数画像・動画・音声などのマルチモーダルな参照入力に対応し、豊かな動きと音声・映像の高い同期性を備えた動画を生成します。参照素材の被写体の外観、動きの特徴、ビジュアルスタイルを忠実に維持し、複数の参照素材を柔軟に組み合わせたコンテンツ制作やショット制御にも対応します。

サンプル

Wan 3.0 Prime example 1

パラメータ

名前既定制約説明
promptプロンプトtextarea≤ 5000 chars最大5000文字。プロンプトまたは参照素材のいずれかが必須です。
images参照画像image_upload_groupimage/jpeg,image/png,image/bmp,image/webp · 0–10 items最大10枚、1枚あたり20MB以下、各辺240〜8000px、アスペクト比8:1以内。PNGの透過は非対応。先頭/末尾フレームとは併用不可。
audios参照音声audio_upload_groupaudio/wav,audio/mpeg · 0–5 items最大5本、1本あたり1〜15秒、合計15秒以内、1本15MB未満。WAV・MP3対応。先頭/末尾フレームとは併用不可。
first_frame先頭フレームimage_uploadimage/jpeg,image/png,image/bmp,image/webp動画の最初のフレームを厳密に指定します。参照画像・動画・音声とは併用不可。
last_frame末尾フレームimage_uploadimage/jpeg,image/png,image/bmp,image/webp動画の最後のフレームを厳密に指定します。参照画像・動画・音声とは併用不可。
resolution解像度select1080P480P | 720P | 1080P
aspect_ratioアスペクト比selectadaptiveadaptive | 16:9 | 4:3 | 1:1 | 3:4 | 9:16自動の場合、プロンプトと入力メディアから最適な比率を選択します。
duration生成時間(秒)number5-1 ~ 30 · step 12〜30秒。-1を指定するとモデルが自動で長さを決定します。動画入力がある場合、入力と出力の合計は30秒以内。自動長さは30秒として事前課金されます。
generate_audio音声を生成booleantrueオフにすると出力動画に音声が含まれません。価格は変わりません。
enable_thinking深い思考モードbooleanfalseドキュメント・Webページ・複雑な画像の解析に必要です。ドキュメントやリンクを入力しない場合は非推奨。
file参照ドキュメントfile_upload.docx,.doc,.xlsx,.xls,.pptx,.ppt,.pdf,.txt,.key,.pages,.numbers,.md · 0–1 items最大1件、100MB以下、50ページ以内。深い思考モードが必要で、Webリンクとは併用不可。
link参照Webページtextログイン不要の公開ページのみ。深い思考モードが必要で、参照ドキュメントとは併用不可。
seedシード値number0 ~ 2147483647 · step 1

API

統一 REST API でこのモデルを呼び出せます。API Keys ページでキーを取得してください。

cURL
# 1) Submit — returns { "task_uuid": "..." }
curl -X POST "https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-3.0-prime/video" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "input": {
    "resolution": "1080P",
    "aspect_ratio": "adaptive",
    "duration": 5,
    "generate_audio": true,
    "enable_thinking": false
  }
}'

# 2) Poll until status is "completed", then read the output URLs
curl "https://www.namifusion.com/api/v1/marketplace/run/tasks/TASK_UUID" \
  -H "Authorization: Bearer YOUR_API_KEY"
Python
import time, requests

API_KEY = "YOUR_API_KEY"
HEADERS = {"Authorization": f"Bearer {API_KEY}"}

# 1) Submit
resp = requests.post(
    "https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-3.0-prime/video",
    headers=HEADERS,
    json={
        "input": {
            "resolution": "1080P",
            "aspect_ratio": "adaptive",
            "duration": 5,
            "generate_audio": True,
            "enable_thinking": False
        }
    },
)
resp.raise_for_status()  # 401/402/429/5xx stop here instead of polling a bad task
task = resp.json()

# 2) Poll until a terminal state (completed / failed / cancelled).
#    This model is allowed up to 300s server-side.
deadline = time.time() + 360
while task.get("status") not in ("completed", "failed", "cancelled"):
    if time.time() > deadline:
        raise TimeoutError(f"still {task.get('status')} — keep the task_uuid and poll later")
    time.sleep(3)
    poll = requests.get(f"https://www.namifusion.com/api/v1/marketplace/run/tasks/{task['task_uuid']}", headers=HEADERS)
    poll.raise_for_status()
    task = poll.json()

print(task["status"], task.get("output"))
JavaScript
const API_KEY = "YOUR_API_KEY";
const HEADERS = { Authorization: `Bearer ${API_KEY}` };

// 1) Submit
const resp = await fetch("https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-3.0-prime/video", {
  method: "POST",
  headers: { ...HEADERS, "Content-Type": "application/json" },
  body: JSON.stringify({
    "input": {
      "resolution": "1080P",
      "aspect_ratio": "adaptive",
      "duration": 5,
      "generate_audio": true,
      "enable_thinking": false
    }
  }),
});
if (!resp.ok) throw new Error(`submit failed: ${resp.status} ${await resp.text()}`);
let task = await resp.json();

// 2) Poll until a terminal state (completed / failed / cancelled).
//    This model is allowed up to 300s server-side.
const deadline = Date.now() + 360 * 1000;
while (!["completed", "failed", "cancelled"].includes(task.status)) {
  if (Date.now() > deadline) throw new Error(`still ${task.status} — keep the task_uuid and poll later`);
  await new Promise((r) => setTimeout(r, 3000));
  const poll = await fetch(`https://www.namifusion.com/api/v1/marketplace/run/tasks/${task.task_uuid}`, { headers: HEADERS });
  if (!poll.ok) throw new Error(`poll failed: ${poll.status}`);
  task = await poll.json();
}

console.log(task.status, task.output);

ドキュメント

Wan 3.0 Video Prime

テキスト・画像・動画・音声・ドキュメントをひとつのモデルで扱い、1回で最大30秒の動画を生成します。

Wan 3.0 Video は、生成時間・全能参照・リアリティを同時に引き上げたオールインワンの動画生成モデルです。1回のリクエストで最大30秒の連続した映像を生成でき、語りのテンポに余裕が生まれ、連続的なカメラワークやワンカット撮影といった複雑な映像表現も十分に成立します。テキスト・画像・音声・動画に加え、シリーズで初めてドキュメント(doc、xls、ppt、pdf、md など)の入力に対応し、オフィス素材をそのまま動画化できます。

🚀 主な特長

  • ネイティブ30秒生成:1カットではなく、ひとつの物語として構成できます。スマート長さ機能により、プロンプトから最適な長さをモデルが提案します。
  • 6モダリティの全能参照:参照画像・動画・音声・ドキュメント・Webページを1回のリクエストで組み合わせ、プロンプトで統括的に制御します。
  • ドキュメントを素材に:doc、xls、ppt、pdf、txt、key、pages、numbers、md から、教材、製品デモ、アニメーショングラフ、業務レポートを生成できます。
  • 超写実的な世界レンダラー:肌や顔立ちのディテールを忠実に描写し、感情表現は自然かつ抑制的。画一的な顔ではなく一人ひとり異なり、群衆シーンでも破綻しません。
  • ピクセルレベルの一貫性:キャラクター、小道具、声、空間関係を参照素材に忠実に揃えます。「似ている」ではなく「再現」です。
  • 厳密な先頭/末尾フレームモード:開始と終了のフレームを厳密に指定し、制御されたトランジションを実現します。
  • 音声付き出力:生成された動画は音声トラックを含みます。オン・オフによる価格差はありません。
  • アスペクト比の自動選択:意図と入力メディアからモデルが最適な比率を選択。5種類のプリセットからの指定も可能です。

🛠️ 技術仕様

項目内容
モデルアーキテクチャオールインワン全能参照型 動画生成モデル
タスクタイプ動画生成(テキスト / 画像 / 動画 / 音声 / ドキュメントから動画)
プロンプト中国語・英語、最大5000文字。プロンプトまたは参照素材のいずれかが必須
出力形式音声付き動画
解像度480P、720P、1080P(デフォルト 1080P)
生成時間2〜30秒(デフォルト 5)。-1 でスマート長さ。動画入力がある場合、入力と出力の合計は30秒以内
アスペクト比adaptive(デフォルト)、16:9、4:3、1:1、3:4、9:16
参照画像最大10枚。JPEG、JPG、PNG(透過非対応)、BMP、WEBP。1枚20MB以下、各辺240〜8000px、比率8:1以内
参照動画最大5本、1本1〜15秒・合計15秒以内。mp4、mov。1本100MB未満、各辺240〜4096px
参照音声最大5本、1本1〜15秒・合計15秒以内。wav、mp3。1本15MB未満
ドキュメント1件、100MB以下、50ページ以内。docx、doc、xlsx、xls、pptx、ppt、pdf、txt、key、pages、numbers、md。思考モードが必要
Webページログイン不要の公開URLを1件。思考モードが必要。ドキュメントとは併用不可
先頭 / 末尾フレーム各1枚。全能参照の入力とは併用不可
思考モードデフォルトはオフ。ドキュメント、Webページ、複雑な画像理解に必要
シード値任意指定。0〜2147483647 で再現性を確保
音声スイッチデフォルトはオン。オン・オフによる価格差なし
レイテンシコールドスタートなし

サンプルプロンプト

  • 動画1が画像3を抱え、画像4の椅子で穏やかなカントリーバラードを弾きながら「今日は良い天気ですね」と言う。画像1が画像2を手に持って動画1の前を通り、画像2を動画1の隣のテーブルに置いて「素敵な演奏ですね、もう一度お願いできますか」と言う。
  • 雨上がりのネオン街を夜に進む、30秒のシネマティックなワンカット。カメラは看板と路面の反射を通り過ぎながら前進し、遠くの交通音を含む環境音を伴う。
  • 添付の製品資料をアニメーション解説動画に変換。主要な数値をオンスクリーンのグラフとして強調し、ブランドカラーを維持し、落ち着いたナレーションのテンポで。

💰 価格

動画の秒数で課金され、入力動画と出力動画の両方が対象です。

課金対象時間 = 入力動画の長さ + 出力動画の長さ

解像度1秒あたりの価格
480P$0.0625
720P$0.125
1080P$0.25

料金例

シナリオ課金対象時間480P720P1080P
出力 10 秒、参照動画なし10 秒$0.625$1.25$2.50
出力 15 秒 + 参照動画 5 秒20 秒$1.25$2.50$5.00
出力 30 秒、参照動画なし30 秒$1.875$3.75$7.50

課金ルール

  • 入力動画と出力動画の両方が課金対象で、動画の秒数に基づきます。
  • 入力動画は実際の入力秒数、出力動画は正常に生成された秒数が課金対象です。
  • 参照画像と参照音声は時間による課金の対象外です。
  • 音声トラックのオン・オフによる価格差はありません
  • 失敗したタスクは課金されず、全額返金されます。
  • スマート長さ(-1)は30秒上限で事前課金し、完了後に実際の生成時間で精算されます。

💡 主なユースケース

  • 完結したショート動画の制作:30秒の連続映像により、テンポ設計、連続カメラワーク、ワンカット表現が可能になります。
  • オフィス素材の動画化:スライド、表計算、PDF から教材、製品デモ、アニメーショングラフ、業務レポートを生成します。
  • キャラクター・スタイルの一貫性:マルチモーダル参照により、人物、衣装、小道具、声をシリーズ全体で揃えられます。
  • EC・広告クリエイティブ:商品画像、ブランドアート、参考映像を1回のリクエストで統合し、広告素材を制作します。
  • 厳密なトランジション:開始と終了のフレームを正確に指定したい場合は、先頭/末尾フレームモードを使用します。

🔗 関連モデル

  • Wan 2.7 Image to Video:1枚の参照画像を動かすだけであれば、より軽量な選択肢です。
  • Wan 2.7 Text to Video:プロンプトのみから短いクリップを生成する用途に適しています。