xAI Grok Imagine Video v1.5 参照画像から動画
x-ai/grok-imagine-video-v1.5/reference-to-video
プロンプトと1-7枚の参照画像から1-15秒の動画を生成します。480pと720pに対応しています。
サンプル
パラメータ
| 名前 | 型 | 既定 | 制約 | 説明 |
|---|---|---|---|---|
| prompt *プロンプト | textarea | — | ≤ 5000 chars | 希望するモーションやシーンを説明するテキストです。 |
| images *参照画像 | image_upload_group | — | image/* · 1–7 items | 動画生成を導く参照画像の URL です。最大 7 枚まで対応しています。 |
| duration長さ | slider | 6 | 1 ~ 15 · step 1 | 出力動画の長さ(秒)。 |
| aspect_ratioアスペクト比 | select | 16:9 | 16:9 | 1:1 | 9:16 | 3:2 | 2:3 | 生成される動画のアスペクト比です。 |
| resolution解像度 | select | 720p | 720p | 480p | 出力動画の解像度です。 |
API
統一 REST API でこのモデルを呼び出せます。API Keys ページでキーを取得してください。
cURL
# 1) Submit — returns { "task_uuid": "..." }
curl -X POST "https://www.namifusion.com/api/v1/marketplace/run/x-ai/grok-imagine-video-v1.5/reference-to-video" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"input": {
"prompt": "A cinematic portrait, dramatic rim light, shallow depth of field",
"images": [
"https://example.com/input.jpg"
],
"duration": 6,
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
# 2) Poll until status is "completed", then read the output URLs
curl "https://www.namifusion.com/api/v1/marketplace/run/tasks/TASK_UUID" \
-H "Authorization: Bearer YOUR_API_KEY"Python
import time, requests
API_KEY = "YOUR_API_KEY"
HEADERS = {"Authorization": f"Bearer {API_KEY}"}
# 1) Submit
resp = requests.post(
"https://www.namifusion.com/api/v1/marketplace/run/x-ai/grok-imagine-video-v1.5/reference-to-video",
headers=HEADERS,
json={
"input": {
"prompt": "A cinematic portrait, dramatic rim light, shallow depth of field",
"images": [
"https://example.com/input.jpg"
],
"duration": 6,
"aspect_ratio": "16:9",
"resolution": "720p"
}
},
)
resp.raise_for_status() # 401/402/429/5xx stop here instead of polling a bad task
task = resp.json()
# 2) Poll until a terminal state (completed / failed / cancelled).
# This model is allowed up to 300s server-side.
deadline = time.time() + 360
while task.get("status") not in ("completed", "failed", "cancelled"):
if time.time() > deadline:
raise TimeoutError(f"still {task.get('status')} — keep the task_uuid and poll later")
time.sleep(3)
poll = requests.get(f"https://www.namifusion.com/api/v1/marketplace/run/tasks/{task['task_uuid']}", headers=HEADERS)
poll.raise_for_status()
task = poll.json()
print(task["status"], task.get("output"))JavaScript
const API_KEY = "YOUR_API_KEY";
const HEADERS = { Authorization: `Bearer ${API_KEY}` };
// 1) Submit
const resp = await fetch("https://www.namifusion.com/api/v1/marketplace/run/x-ai/grok-imagine-video-v1.5/reference-to-video", {
method: "POST",
headers: { ...HEADERS, "Content-Type": "application/json" },
body: JSON.stringify({
"input": {
"prompt": "A cinematic portrait, dramatic rim light, shallow depth of field",
"images": [
"https://example.com/input.jpg"
],
"duration": 6,
"aspect_ratio": "16:9",
"resolution": "720p"
}
}),
});
if (!resp.ok) throw new Error(`submit failed: ${resp.status} ${await resp.text()}`);
let task = await resp.json();
// 2) Poll until a terminal state (completed / failed / cancelled).
// This model is allowed up to 300s server-side.
const deadline = Date.now() + 360 * 1000;
while (!["completed", "failed", "cancelled"].includes(task.status)) {
if (Date.now() > deadline) throw new Error(`still ${task.status} — keep the task_uuid and poll later`);
await new Promise((r) => setTimeout(r, 3000));
const poll = await fetch(`https://www.namifusion.com/api/v1/marketplace/run/tasks/${task.task_uuid}`, { headers: HEADERS });
if (!poll.ok) throw new Error(`poll failed: ${poll.status}`);
task = await poll.json();
}
console.log(task.status, task.output);ドキュメント
xAI Grok Imagine Video v1.5 Reference to Video
最大 7 枚の参照画像から、人物やスタイルの一貫性を保った短尺動画を生成。
🚀 主な特長
- 参照画像ベースの動画生成:1~7 枚の参照画像を使って、被写体の見た目、アイデンティティ、スタイルを動画に反映できます。
- プロンプトによるモーション制御:動き、カメラワーク、雰囲気、シーン展開を自然言語のプロンプトで指定できます。
- 被写体とスタイルの一貫性:複数の参照画像により、キャラクターやブランド表現の統一感を維持しやすくなります。
- 柔軟な出力設定:480p / 720p に対応し、複数のアスペクト比から用途に応じて選択できます。
- 実運用向けの性能:キャラクター動画、広告クリエイティブ、コンセプト可視化、短編ストーリーテリングに適しています。
🛠️ 技術仕様
| 項目 | 内容 |
|---|---|
| モデルアーキテクチャ | 参照画像ガイド型の画像から動画生成モデル |
| 入力 | プロンプト + 1~7 枚の参照画像 |
| 出力形式 | 動画 |
| 参照画像枚数 | 最大 7 枚 |
| 長さ | 1~15 秒(デフォルト:6 秒) |
| アスペクト比 | 16:9、1:1、9:16、3:2、2:3(デフォルト:16:9) |
| 解像度 | 720p、480p(デフォルト:720p) |
| モーション / スタイル制御 | 参照画像とプロンプトの組み合わせで制御 |
| レイテンシ | 高速推論向けに最適化。実際の処理時間は長さ、解像度、参照画像枚数に依存します |
| 主な用途 | キャラクター主導の動画、被写体一貫性のある動画、試作、マーケティング素材 |
サンプルプロンプト
- 夕暮れの街をスタイリッシュな女性がゆっくり歩く。髪が風になびき、カメラは滑らかに追従し、シネマティックな照明。
- 参照画像のキャラクターがネオンの下でカメラを振り向き、浅い被写界深度で幻想的かつモダンな雰囲気。
- 被写体が自然に手を動かしながら微笑み、カメラがミディアムショットからクローズアップへゆっくり寄っていく、SNS 向けのプロモーション風映像。
💰 価格
| 料金項目 | 価格 |
|---|---|
| 最低料金例(480p・1秒・画像1枚) | $0.09 |
| 480p | $0.08 / 秒 |
| 720p | $0.14 / 秒 |
| 参照画像追加 | 1 枚ごとに +$0.01 |
| 課金ルール | 長さに応じた線形課金。秒数は切り上げで計算 |
料金例(参照画像 1 枚)
| 解像度 | 1 秒 | 5 秒 | 10 秒 | 15 秒 |
|---|---|---|---|---|
| 480p | $0.09 | $0.41 | $0.81 | $1.21 |
| 720p | $0.15 | $0.71 | $1.41 | $2.11 |
💡 主なユースケース
- 被写体の一貫性が重要な動画制作:キャラクター、タレント、ブランドビジュアルを保った短尺動画の生成に適しています。
- SNS 向けコンテンツ制作:縦長、正方形、横向きなど、配信先に合わせたスタイライズ動画を素早く作成できます。
- 広告・マーケティング素材:商品や人物の参照画像をもとに、統一感のあるモーション素材を生成できます。
- コンセプト可視化と試作:本制作前に、動きやカメラ演出、雰囲気の方向性を迅速に検証できます。
🔗 関連モデル
- xAI Grok Imagine Video v1.5 Text-to-Video:プロンプトのみから動画を生成するモデルです。
- xAI Grok Imagine Video v1.5 Image-to-Video:単一の画像をアニメーション化する、よりシンプルな画像から動画ワークフロー向けモデルです。
関連モデル
MiniMax H3 参照画像から動画生成
MiniMax H3 Reference to Video は、自然言語のプロンプトと画像・動画・音声を含むマルチモーダルな参照情報から、一貫性のある 2K 動画を生成します。被写体の一貫性、モーション、タイミング、ビジュアルスタイル、シーンの連続性をコントロールできます。すぐに使える REST 推論 API を提供し、高性能・コールドスタートなし・手頃な価格で利用できます。
Gemini Omni Flash 参照画像から動画生成 API
Gemini Omni Flash 参照画像から動画生成は、1枚以上の参照画像とテキストのプロンプトから、音声が同期した短い AI 動画を生成します。視覚的な一貫性を保ちながら、提供された参照内容に従ってガイド付きのマルチモーダル動画生成を行います。すぐに使える REST 推論 API、高性能、コールドスタートなし、手頃な価格。
Seedance 2.0 Mini 参照生成動画
Seedance 2.0 Mini Reference-to-Video(リファレンス画像指定動画生成)は、ByteDance(バイトダンス)が開発した、シネマティックなマルチショット動画の作成に最適な、高速かつ低コストな動画生成モデルです。参考画像とテキストプロンプトを高度に融合させ、ストーリー性豊かな動画セグメントを生成します。AIによる柔軟なカメラワーク制御に対応しているだけでなく、異なるシーン間でのキャラクターの同一性を維持するという課題もクリアしています。480Pから4Kまでのマルチ解像度出力、4〜15秒の動画長、そして自由なアスペクト比をサポート。すぐに使えるREST推論APIが提供されており、コールドスタートなしの圧倒的なパフォーマンスを圧倒的なコストパフォーマンスで実現します。
Seedance 2.0 Fast reference-to-video
Seedance 2.0 Fast(Video-Edit)は、自然言語のプロンプトに基づいて入力動画をより高速かつ低コストで編集できます。ByteDance Seed の統合マルチモーダルアーキテクチャを基盤とし、被写体の同一性、構図、動きを保ちながら、指示に応じてライティング、スタイル、天候、環境、特定の要素を書き換えます。すぐに使える REST API、優れたパフォーマンス、コールドスタートなし、手頃な価格に対応しています。