Alibaba WAN 2.5
alibaba/wan-2.5/text-to-video
Alibaba WAN 2.5 は、480p から 1080p までの高解像度なテキスト/画像からの動画生成に対応し、完璧なオーディオ同期を実現しました。Google Veo 3 を凌ぐ生成速度と圧倒的なコストパフォーマンスを誇ります。即時利用可能な REST 推理 API により、コールドスタートなしで最高のパフォーマンスを提供し、クリエイティブな制作コストを劇的に削減します。
サンプル
パラメータ
| 名前 | 型 | 既定 | 制約 | 説明 |
|---|---|---|---|---|
| prompt *プロンプト | textarea | — | ≤ 5000 chars | 生成のためのポジティブプロンプト。 |
| negative_promptネガティブプロンプト | textarea | — | ≤ 5000 chars | 生成のためのネガティブプロンプト。 |
| audio音声 | audio_upload | — | — | 生成をガイドするための音声 URL(オプション)。 |
| sizeサイズ | select | 1920*1080 | 1920*1080 | 1080*1920 | 1440*1440 | 1632*1248 | 1248*1632 | 1280*720 | 720*1280 | 960*960 | … | 生成されたメディアのサイズ(ピクセル単位、幅*高さ)。 |
| duration長さ | select | 5 | 5 | 10 | 15 | 生成されたメディアの長さ(秒単位)。 |
| prompt_extendプロンプト拡張を有効にする | boolean | false | — | true に設定すると、プロンプトオプティマイザーが有効になります。 |
| seedシード値 | number | -1 | — | 生成に使用するランダムシード。-1 はランダムシードが使用されることを意味します。 |
API
統一 REST API でこのモデルを呼び出せます。API Keys ページでキーを取得してください。
cURL
# 1) Submit — returns { "task_uuid": "..." }
curl -X POST "https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-2.5/text-to-video" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"input": {
"prompt": "A serene sunset over a calm ocean with gentle waves and a silhouetted sailboat on the horizon.",
"negative_prompt": "crowded beach, noisy environment, stormy weather",
"size": "1920*1080",
"duration": 10,
"prompt_extend": true,
"seed": 42
}
}'
# 2) Poll until status is "completed", then read the output URLs
curl "https://www.namifusion.com/api/v1/marketplace/run/tasks/TASK_UUID" \
-H "Authorization: Bearer YOUR_API_KEY"Python
import time, requests
API_KEY = "YOUR_API_KEY"
HEADERS = {"Authorization": f"Bearer {API_KEY}"}
# 1) Submit
resp = requests.post(
"https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-2.5/text-to-video",
headers=HEADERS,
json={
"input": {
"prompt": "A serene sunset over a calm ocean with gentle waves and a silhouetted sailboat on the horizon.",
"negative_prompt": "crowded beach, noisy environment, stormy weather",
"size": "1920*1080",
"duration": 10,
"prompt_extend": True,
"seed": 42
}
},
)
resp.raise_for_status() # 401/402/429/5xx stop here instead of polling a bad task
task = resp.json()
# 2) Poll until a terminal state (completed / failed / cancelled).
# This model is allowed up to 300s server-side.
deadline = time.time() + 360
while task.get("status") not in ("completed", "failed", "cancelled"):
if time.time() > deadline:
raise TimeoutError(f"still {task.get('status')} — keep the task_uuid and poll later")
time.sleep(3)
poll = requests.get(f"https://www.namifusion.com/api/v1/marketplace/run/tasks/{task['task_uuid']}", headers=HEADERS)
poll.raise_for_status()
task = poll.json()
print(task["status"], task.get("output"))JavaScript
const API_KEY = "YOUR_API_KEY";
const HEADERS = { Authorization: `Bearer ${API_KEY}` };
// 1) Submit
const resp = await fetch("https://www.namifusion.com/api/v1/marketplace/run/alibaba/wan-2.5/text-to-video", {
method: "POST",
headers: { ...HEADERS, "Content-Type": "application/json" },
body: JSON.stringify({
"input": {
"prompt": "A serene sunset over a calm ocean with gentle waves and a silhouetted sailboat on the horizon.",
"negative_prompt": "crowded beach, noisy environment, stormy weather",
"size": "1920*1080",
"duration": 10,
"prompt_extend": true,
"seed": 42
}
}),
});
if (!resp.ok) throw new Error(`submit failed: ${resp.status} ${await resp.text()}`);
let task = await resp.json();
// 2) Poll until a terminal state (completed / failed / cancelled).
// This model is allowed up to 300s server-side.
const deadline = Date.now() + 360 * 1000;
while (!["completed", "failed", "cancelled"].includes(task.status)) {
if (Date.now() > deadline) throw new Error(`still ${task.status} — keep the task_uuid and poll later`);
await new Promise((r) => setTimeout(r, 3000));
const poll = await fetch(`https://www.namifusion.com/api/v1/marketplace/run/tasks/${task.task_uuid}`, { headers: HEADERS });
if (!poll.ok) throw new Error(`poll failed: ${poll.status}`);
task = await poll.json();
}
console.log(task.status, task.output);ドキュメント
WAN 2.5 Text-to-Video
テキストプロンプトからシネマティックな動画を生成します。
WAN 2.5 Text-to-Video は、自然言語のプロンプトを動きのある動画へ変換する次世代 AI 動画生成モデルです。従来の WAN モデルと比べて、より自然なモーション表現、優れたシーン理解、そしてフレーム間の高い一貫性を実現しています。開発者やクリエイターは、本番環境対応の REST 推論 API を利用することで、テキストから動画生成機能をアプリケーションやクリエイティブパイプライン、自動化されたコンテンツ制作フローに簡単に統合できます。
🚀 主な特徴
-
Text-to-Video 生成
自然言語のプロンプトから、シーンが一貫した動画クリップを生成します。 -
強化されたモーション品質
WAN 2.5 はより滑らかで自然なフレーム間モーションを生成します。 -
高度なシーン理解
複雑なプロンプトをより正確に理解し、一貫したビジュアル環境を生成します。 -
複数解像度対応
用途に応じて複数の解像度で動画を生成できます。 -
本番対応 API
REST API を通じてアプリケーションやクリエイティブツールへ簡単に統合できます。
🛠️ 仕組み
| パラメータ | 詳細 |
|---|---|
| 入力 | テキストプロンプト |
| 出力 | 生成された動画 (MP4) |
| 解像度オプション | 480p、720p、1080p |
| 動画長さ | 通常 5 秒 |
| Seed | デフォルト: -1(ランダム) |
生成例
- シーン生成: 「夕焼けの未来都市のスカイライン、空飛ぶ車が行き交う」
- キャラクターの動き: 「ネオン街をゆっくり歩く女性」
- 商品ビジュアル: 「黒い反射テーブルの上で回転する高級腕時計」
- シネマティック演出: 「岩に打ち寄せる波のスローモーション」
💰 料金
| 解像度 | 価格 (USD/秒) |
|---|---|
| 480p | $0.05 |
| 720p | $0.10 |
| 1080p | $0.15 |
💡 主な利用シーン
-
ソーシャルメディアコンテンツ
TikTok、Instagram、YouTube Shorts 向けの短い動画を生成。 -
広告・マーケティング
テキストプロンプトからプロモーション動画や商品コンセプトを生成。 -
クリエイティブストーリーボード
本格的な動画制作前にシーンを可視化。 -
AI コンテンツ制作パイプライン
自動化されたメディア制作フローに統合。
🔗 関連モデル
- 画像から動画を生成する場合 → WAN 2.5 Image-to-Video
- シンプルな動画生成 → WAN 2.2 Text-to-Video Plus
- 動画を延長する場合 → WAN Spicy Video Extend
注: 生成品質はプロンプトの内容や複雑さによって変化します。動き、被写体、環境を詳しく記述するとより良い結果が得られます。
関連モデル
xAI Grok Imagine Video v1.5 テキストから動画生成
テキストプロンプトから1-15秒の動画を生成します。480p、720p、1080pに対応しています。
MiniMax H3 テキストから動画生成
MiniMax H3 テキストから動画生成は、プロンプトから一貫性のある 2K 動画を生成できます。4〜15秒の柔軟な長さと、6種類のアスペクト比に対応し、シネマティックなシーン、クリエイティブ動画、制作ワークフローに適しています。すぐに使える REST 推論 API を提供し、高性能・コールドスタートなし・手頃な価格で利用できます。
Kling Omni Video O3 標準版テキストから動画生成
Kling Omni Video O3 は、MVL(マルチモーダルビジュアルランゲージ)技術を採用したKuaishouの高度な統合型マルチモーダル動画モデルです。テキストから動画生成モードでは、プロンプトを基に主体の一貫性、自然な物理シミュレーション、正確な意味理解を備えた映画品質の動画を生成します。音声生成にも対応。すぐに使えるREST API、最高のパフォーマンス、冷スタートなし、手頃な価格。
Kling Omni Video O1 テキストから動画生成
Kling Omni Video O1 は、MVL(マルチモーダルビジュアルランゲージ)技術を採用したKuaishou初の統合型マルチモーダル動画モデルです。テキストから動画生成モードでは、プロンプトに基づいて映画品質の動画を生成し、主体の一貫性、自然な物理シミュレーション、正確な意味理解を実現します。すぐに使えるREST API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling 3.0 標準版
Kling 3.0 標準版は、高品質なテキストから動画生成を提供します。滑らかな動き、映画のような映像、正確なプロンプトの適合性、そして共有可能なクリップ用のネイティブ音声を備えています。即時利用可能な REST 推論 API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling V2.6 テキストから動画生成 API
Kling 2.6 は、滑らかなモーション、映画のようなビジュアル、強力なプロンプト適合性、そしてネイティブオーディオを備えた、トップクラスのテキストから動画生成を提供します。共有可能なクリップを即座に生成可能。すぐに使用できる REST 推論 API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Gemini Omni Flash テキストから動画生成 API
Gemini Omni Flash Text to Video は、テキストのプロンプトから音声同期付きの短い AI 動画を生成し、映像生成と音声出力を組み合わせて高速なマルチモーダル動画作成を実現します。すぐに使える REST 推論 API で、高性能、コールドスタートなし、手頃な価格です。
Seedance 2.0 Mini テキストから動画生成
Seedance 2.0 Mini Text to Video は、ByteDance による高速かつ低コストなテキストから動画生成モデルで、シネマティックなマルチショット動画に適しています。テキストのプロンプトから物語性のあるシーケンスを生成し、AI カメラ制御、シーン間で一貫したキャラクター、480P / 720P / 1080P / 4K 出力、4〜15 秒の長さ、柔軟なアスペクト比に対応しています。すぐに使える REST 推論 API を提供し、高性能、コールドスタートなし、手頃な価格が特長です。