xAI Grok Imagine Video v1.5 参考图转视频
x-ai/grok-imagine-video-v1.5/reference-to-video
使用提示词和 1-7 张参考图片生成 1-15 秒视频,支持 480p 和 720p。
示例
参数
| 名称 | 类型 | 默认 | 约束 | 说明 |
|---|---|---|---|---|
| prompt *提示词 | textarea | — | ≤ 5000 chars | 描述所需运动和场景的文本内容。 |
| images *参考图片 | image_upload_group | — | image/* · 1–7 items | 用于引导视频生成的参考图片 URL。最多支持 7 张图片。 |
| duration时长 | slider | 6 | 1 ~ 15 · step 1 | 输出视频的时长(秒)。 |
| aspect_ratio宽高比 | select | 16:9 | 16:9 | 1:1 | 9:16 | 3:2 | 2:3 | 生成视频的宽高比。 |
| resolution分辨率 | select | 720p | 720p | 480p | 输出视频分辨率。 |
API
通过统一 REST API 调用本模型;在 API Keys 页获取密钥。
cURL
# 1) Submit — returns { "task_uuid": "..." }
curl -X POST "https://www.namifusion.com/api/v1/marketplace/run/x-ai/grok-imagine-video-v1.5/reference-to-video" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"input": {
"prompt": "A cinematic portrait, dramatic rim light, shallow depth of field",
"images": [
"https://example.com/input.jpg"
],
"duration": 6,
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
# 2) Poll until status is "completed", then read the output URLs
curl "https://www.namifusion.com/api/v1/marketplace/run/tasks/TASK_UUID" \
-H "Authorization: Bearer YOUR_API_KEY"Python
import time, requests
API_KEY = "YOUR_API_KEY"
HEADERS = {"Authorization": f"Bearer {API_KEY}"}
# 1) Submit
resp = requests.post(
"https://www.namifusion.com/api/v1/marketplace/run/x-ai/grok-imagine-video-v1.5/reference-to-video",
headers=HEADERS,
json={
"input": {
"prompt": "A cinematic portrait, dramatic rim light, shallow depth of field",
"images": [
"https://example.com/input.jpg"
],
"duration": 6,
"aspect_ratio": "16:9",
"resolution": "720p"
}
},
)
resp.raise_for_status() # 401/402/429/5xx stop here instead of polling a bad task
task = resp.json()
# 2) Poll until a terminal state (completed / failed / cancelled).
# This model is allowed up to 300s server-side.
deadline = time.time() + 360
while task.get("status") not in ("completed", "failed", "cancelled"):
if time.time() > deadline:
raise TimeoutError(f"still {task.get('status')} — keep the task_uuid and poll later")
time.sleep(3)
poll = requests.get(f"https://www.namifusion.com/api/v1/marketplace/run/tasks/{task['task_uuid']}", headers=HEADERS)
poll.raise_for_status()
task = poll.json()
print(task["status"], task.get("output"))JavaScript
const API_KEY = "YOUR_API_KEY";
const HEADERS = { Authorization: `Bearer ${API_KEY}` };
// 1) Submit
const resp = await fetch("https://www.namifusion.com/api/v1/marketplace/run/x-ai/grok-imagine-video-v1.5/reference-to-video", {
method: "POST",
headers: { ...HEADERS, "Content-Type": "application/json" },
body: JSON.stringify({
"input": {
"prompt": "A cinematic portrait, dramatic rim light, shallow depth of field",
"images": [
"https://example.com/input.jpg"
],
"duration": 6,
"aspect_ratio": "16:9",
"resolution": "720p"
}
}),
});
if (!resp.ok) throw new Error(`submit failed: ${resp.status} ${await resp.text()}`);
let task = await resp.json();
// 2) Poll until a terminal state (completed / failed / cancelled).
// This model is allowed up to 300s server-side.
const deadline = Date.now() + 360 * 1000;
while (!["completed", "failed", "cancelled"].includes(task.status)) {
if (Date.now() > deadline) throw new Error(`still ${task.status} — keep the task_uuid and poll later`);
await new Promise((r) => setTimeout(r, 3000));
const poll = await fetch(`https://www.namifusion.com/api/v1/marketplace/run/tasks/${task.task_uuid}`, { headers: HEADERS });
if (!poll.ok) throw new Error(`poll failed: ${poll.status}`);
task = await poll.json();
}
console.log(task.status, task.output);文档
xAI Grok Imagine Video v1.5 Reference to Video
基于多张参考图片生成风格统一、角色一致的短视频。
🚀 关键特性
- 参考图驱动生成:支持上传 1~7 张参考图片,用于约束主体身份、外观特征与整体风格。
- 提示词控制运动与镜头:通过自然语言提示词描述动作、场景变化、氛围和镜头运动,提升视频可控性。
- 角色与风格一致性:多参考图输入有助于在整段视频中保持人物、品牌形象或视觉设定的一致性。
- 灵活输出设置:支持 480p 与 720p 分辨率,并可选择多种宽高比,适配横屏、竖屏和方形内容发布需求。
- 适合生产工作流:适用于角色内容、创意预演、广告素材和社交媒体短视频制作。
🛠️ 技术规格
| 项目 | 说明 |
|---|---|
| 模型架构 | 参考图驱动的图片到视频生成模型 |
| 输入内容 | 提示词 + 1~7 张参考图片 |
| 输出内容 | 短视频 |
| 参考图片数量 | 最多 7 张 |
| 时长 | 1~15 秒(默认 6 秒) |
| 宽高比 | 16:9、1:1、9:16、3:2、2:3(默认 16:9) |
| 分辨率 | 720p、480p(默认 720p) |
| 风格控制 | 通过参考图片与提示词联合控制主体一致性、运动和氛围 |
| 延迟表现 | 面向快速推理优化;实际耗时通常与时长、分辨率和参考图片数量相关 |
| 适用任务 | 角色驱动视频、身份一致性视频、创意短片、营销内容生成 |
示例提示词
- 一位时尚女性在城市街头缓慢行走,微风吹动头发,镜头平稳跟拍,电影感光影。
- 参考图片中的角色在霓虹灯下转身微笑,背景有轻微景深变化,整体氛围梦幻且现代。
- 让主体面向镜头做自然动作,镜头从中景缓慢推进到近景,适合社交媒体宣传片风格。
💰 价格
| 计费项 | 价格 |
|---|---|
| 最低示例价(480p、1 秒、1 张图) | $0.09 |
| 480p | $0.08 / 秒 |
| 720p | $0.14 / 秒 |
| 每增加 1 张参考图片 | +$0.01 |
| 计费规则 | 按时长线性计费,向上取整到整秒 |
价格示例(1 张参考图片)
| 分辨率 | 1 秒 | 5 秒 | 10 秒 | 15 秒 |
|---|---|---|---|---|
| 480p | $0.09 | $0.41 | $0.81 | $1.21 |
| 720p | $0.15 | $0.71 | $1.41 | $2.11 |
💡 最佳使用场景
- 角色一致性内容制作:为虚拟角色、IP 形象或品牌代言人生成连续且统一的短视频内容。
- 社交媒体创意视频:快速制作适配竖屏、方形或横屏平台的风格化短视频。
- 广告与营销素材:基于产品或人物参考图生成更具视觉统一性的宣传片段。
- 概念验证与创意预演:在正式拍摄前快速测试镜头语言、动作方向和整体氛围。
🔗 相关模型
- xAI Grok Imagine Video v1.5 Text-to-Video:仅基于提示词生成视频,适合从零开始的创意生成。
- xAI Grok Imagine Video v1.5 Image-to-Video:基于单张图片进行动画化,适合更轻量的图片到视频工作流。
相关模型
MiniMax H3 参考图生视频
MiniMax H3 Reference to Video 可根据自然语言提示词和多模态参考内容生成连贯的 2K 视频,支持图片、视频和音频输入,可引导主体一致性、运动、时序、视觉风格和场景连贯性。提供开箱即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Gemini Omni Flash 参考图生视频 API
Gemini Omni Flash 参考图生视频可根据一张或多张参考图片和文本提示词生成带同步音频的短视频,保持视觉主体一致性,并依据提供的参考内容进行引导式多模态视频生成。即开即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Seedance 2.0 Mini 参考生视频
Seedance 2.0 Mini 参考图生视频 (Reference-to-Video) 是字节跳动推出的一款高速度、低成本的视频生成模型,专注于创作具有电影质感的多镜头视频。该模型能够完美融合参考图与文本提示词,生成极具叙事感的连续视频片段。它不仅支持灵动的 AI 镜头控制,更攻克了跨场景角色一致性的难题。模型支持从 480P 到 4K 的多分辨率输出,时长跨越 4-15 秒,并适配灵活的宽高比。提供开箱即用的 REST 推理 API,性能卓越,告别冷启动,是极具性价比的专业视频创作利器
Seedance 2.0 Fast 视频编辑
Seedance 2.0 Fast(reference-to-video)可根据自然语言提示词对输入视频进行编辑,速度更快、成本更低。基于字节跳动 Seed 统一多模态架构构建,在按指令重写光照、风格、天气、环境或特定元素的同时,保留主体身份、构图和运动。提供开箱即用的 REST API,性能出色,无冷启动,价格实惠。