MiniMax H3 参照画像から動画生成

minimax/h3/reference-to-video

MiniMax H3 Reference to Video は、自然言語のプロンプトと画像・動画・音声を含むマルチモーダルな参照情報から、一貫性のある 2K 動画を生成します。被写体の一貫性、モーション、タイミング、ビジュアルスタイル、シーンの連続性をコントロールできます。すぐに使える REST 推論 API を提供し、高性能・コールドスタートなし・手頃な価格で利用できます。

サンプル

MiniMax H3 参照画像から動画生成 example 1

パラメータ

名前既定制約説明
prompt *プロンプトtextarea≤ 7000 chars生成したい動画のシーンや動き、相互作用を説明するテキストです。
images参照画像image_upload_groupimage/* · 1–9 items参照画像の URL。少なくとも 1 枚の参照画像または 1 本の参照動画が必要です。
audios参照音声audio_upload_groupaudio/* · 0–3 items任意の参照音声 URL。音声のみを単独で指定することはできません。
aspect_ratioアスペクト比selectadaptive21:9 | 16:9 | 4:3 | 1:1 | 3:4 | 9:16 | adaptive出力動画のアスペクト比です。
resolution解像度select2k2k出力動画の解像度です。
duration長さslider54 ~ 15 · step 1出力動画の長さ(秒)。

出力フィールド

フィールド説明
videosarray<string>Generated video URLs

API

統一 REST API でこのモデルを呼び出せます。API Keys ページでキーを取得してください。

cURL
# 1) Submit — returns { "task_uuid": "..." }
curl -X POST "https://www.namifusion.com/api/v1/marketplace/run/minimax/h3/reference-to-video" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "input": {
    "prompt": "A cinematic portrait, dramatic rim light, shallow depth of field",
    "aspect_ratio": "adaptive",
    "resolution": "2k",
    "duration": 5
  }
}'

# 2) Poll until status is "completed", then read the output URLs
curl "https://www.namifusion.com/api/v1/marketplace/run/tasks/TASK_UUID" \
  -H "Authorization: Bearer YOUR_API_KEY"
Python
import time, requests

API_KEY = "YOUR_API_KEY"
HEADERS = {"Authorization": f"Bearer {API_KEY}"}

# 1) Submit
resp = requests.post(
    "https://www.namifusion.com/api/v1/marketplace/run/minimax/h3/reference-to-video",
    headers=HEADERS,
    json={
        "input": {
            "prompt": "A cinematic portrait, dramatic rim light, shallow depth of field",
            "aspect_ratio": "adaptive",
            "resolution": "2k",
            "duration": 5
        }
    },
)
resp.raise_for_status()  # 401/402/429/5xx stop here instead of polling a bad task
task = resp.json()

# 2) Poll until a terminal state (completed / failed / cancelled).
#    This model is allowed up to 300s server-side.
deadline = time.time() + 360
while task.get("status") not in ("completed", "failed", "cancelled"):
    if time.time() > deadline:
        raise TimeoutError(f"still {task.get('status')} — keep the task_uuid and poll later")
    time.sleep(3)
    poll = requests.get(f"https://www.namifusion.com/api/v1/marketplace/run/tasks/{task['task_uuid']}", headers=HEADERS)
    poll.raise_for_status()
    task = poll.json()

print(task["status"], task.get("output"))
JavaScript
const API_KEY = "YOUR_API_KEY";
const HEADERS = { Authorization: `Bearer ${API_KEY}` };

// 1) Submit
const resp = await fetch("https://www.namifusion.com/api/v1/marketplace/run/minimax/h3/reference-to-video", {
  method: "POST",
  headers: { ...HEADERS, "Content-Type": "application/json" },
  body: JSON.stringify({
    "input": {
      "prompt": "A cinematic portrait, dramatic rim light, shallow depth of field",
      "aspect_ratio": "adaptive",
      "resolution": "2k",
      "duration": 5
    }
  }),
});
if (!resp.ok) throw new Error(`submit failed: ${resp.status} ${await resp.text()}`);
let task = await resp.json();

// 2) Poll until a terminal state (completed / failed / cancelled).
//    This model is allowed up to 300s server-side.
const deadline = Date.now() + 360 * 1000;
while (!["completed", "failed", "cancelled"].includes(task.status)) {
  if (Date.now() > deadline) throw new Error(`still ${task.status} — keep the task_uuid and poll later`);
  await new Promise((r) => setTimeout(r, 3000));
  const poll = await fetch(`https://www.namifusion.com/api/v1/marketplace/run/tasks/${task.task_uuid}`, { headers: HEADERS });
  if (!poll.ok) throw new Error(`poll failed: ${poll.status}`);
  task = await poll.json();
}

console.log(task.status, task.output);

ドキュメント

MiniMax H3 Reference to Video

マルチモーダル参照で一貫性・動き・シーン連続性を高める 2K 動画生成モデルです。

MiniMax H3 Reference to Video は、自然言語のプロンプトと参照メディアを組み合わせて、一貫性の高い 2K 動画を生成できる image-to-video モデルです。画像・動画・任意の音声を条件として利用でき、被写体の一貫性、モーション、タイミング、ビジュアルスタイル、シーンのつながりをより細かくコントロールできます。さらに、コールドスタートなしで扱いやすく、コスト効率にも優れています。

🚀 主な特長

  • マルチモーダル参照生成:プロンプトに加えて、参照画像、参照動画、任意の参照音声を使い、より制御しやすい動画生成が可能です。
  • 被写体の一貫性を強化:参照画像を使うことで、キャラクター、商品、オブジェクト、ブランド表現の見た目を安定させやすくなります。
  • モーションとカメラ表現を誘導:参照動画により、動き、テンポ、インタラクション、カメラモーションを反映しやすくなります。
  • ネイティブ 2K 出力:高精細な 2K 動画を出力でき、商用クリエイティブやコンセプト制作に適しています。
  • 柔軟なアスペクト比:21:9、16:9、4:3、1:1、3:4、9:16、Adaptive(自動)に対応し、シネマティック、横向き、正方形、縦長の各形式をカバーします。
  • コールドスタートなし・導入しやすい価格:安定した生成ワークフローや高速な試行錯誤、大量制作にも適しています。

🛠️ 技術仕様

項目内容
モデル名MiniMax H3 Reference to Video
モデル IDminimax/h3/reference-to-video
モデルアーキテクチャマルチモーダル条件付けに対応した参照誘導型 image-to-video 生成モデル
タスクタイプreference-to-video
入力形式プロンプト + 参照画像および/または参照動画 + 任意の参照音声
出力形式動画
解像度2K(固定)
長さ4〜15 秒
アスペクト比21:9、16:9、4:3、1:1、3:4、9:16、Adaptive(自動)
参照画像数最大 9 枚
参照動画数最大 3 本
参照音声数最大 3 件(単独使用不可)
入力条件少なくとも 1 つの参照画像または参照動画が必要
レイテンシ提供元はコールドスタートなしを訴求
主な強み被写体の一貫性、モーション誘導、スタイル制御、タイミング、シーン連続性

サンプルプロンプト

  1. 未来的なジャケットを着た女性が、雨上がりのネオン街を歩く。カメラはゆっくり前進し、路面の反射が印象的で、映画的なライティング、高精細。
  2. 参照商品画像を使って、高級感のある商品広告動画を生成する。カメラは滑らかに周回し、背景はクリーンなスタジオ、上品な照明、洗練された動き。
  3. 参照キャラクター画像と参照モーション動画をもとに、夕暮れの海辺でキャラクターが走り、振り返って微笑むシーンを生成する。カメラはやさしく追従する。

💰 価格

料金項目価格
基本料金1 出力秒あたり $0.13
5 秒出力$0.65
10 秒出力$1.30
15 秒出力$1.95

課金ルール

項目ルール
参照画像最初の 5 枚は無料、6 枚目以降は 1 枚あたり $0.04
参照動画合計長さに基づき 1 秒あたり $0.13
参照音声対応する音声入力は無料
参照動画の上限最大 3 本、1 リクエストあたり合計 15 秒まで

💡 最適なユースケース

  • 広告・EC 動画制作:商品画像、ブランド素材、参照映像から、高品質な短尺プロモーション動画を生成できます。
  • キャラクター・IP 一貫性のある制作:人物、アバター、マスコット、ブランド被写体の見た目を安定させたクリップ生成に適しています。
  • 絵コンテ・コンセプト開発:文章アイデアと参照素材をもとに、シーン、カメラワーク、ビジュアル方向性を素早く試作できます。
  • SNS・モバイル向けコンテンツ:縦長、正方形、横向きなど、配信先に合わせた動画フォーマットを作成できます。

🔗 関連モデル

  • MiniMax H3 Text-to-Video:テキストのみのプロンプトから高解像度動画を生成したい場合に適しています。
  • MiniMax H3 Image-to-Video:最初のフレーム画像とプロンプトから動画を生成したい場合に適しています。

活用のポイント

  • 被写体の同一性、商品ディテール、スタイルの一貫性が重要な場合は、鮮明で関連性の高い参照画像を使用してください。
  • 動き、テンポ、インタラクション、カメラモーションを重視する場合は、参照動画の利用が効果的です。
  • プロンプトでは、見える動作、シーン展開、カメラ表現、ライティング、雰囲気を具体的に記述すると効果的です。
  • まずは短い長さで試行し、構図や方向性が固まってから長めの動画に拡張するのがおすすめです。
  • 配信先に応じてアスペクト比を選んでください。16:9 は標準的な横向き、9:16 はモバイル向け縦長、1:1 は正方形 SNS コンテンツに適しています。

関連モデル

Gemini Omni Flash 参照画像から動画生成 API
Reference to VideoGoogle

Gemini Omni Flash 参照画像から動画生成 API

Gemini Omni Flash 参照画像から動画生成は、1枚以上の参照画像とテキストのプロンプトから、音声が同期した短い AI 動画を生成します。視覚的な一貫性を保ちながら、提供された参照内容に従ってガイド付きのマルチモーダル動画生成を行います。すぐに使える REST 推論 API、高性能、コールドスタートなし、手頃な価格。

$1.28 / 1 回
Seedance 2.0 Mini 参照生成動画
Reference to VideoDoubao

Seedance 2.0 Mini 参照生成動画

Seedance 2.0 Mini Reference-to-Video(リファレンス画像指定動画生成)は、ByteDance(バイトダンス)が開発した、シネマティックなマルチショット動画の作成に最適な、高速かつ低コストな動画生成モデルです。参考画像とテキストプロンプトを高度に融合させ、ストーリー性豊かな動画セグメントを生成します。AIによる柔軟なカメラワーク制御に対応しているだけでなく、異なるシーン間でのキャラクターの同一性を維持するという課題もクリアしています。480Pから4Kまでのマルチ解像度出力、4〜15秒の動画長、そして自由なアスペクト比をサポート。すぐに使えるREST推論APIが提供されており、コールドスタートなしの圧倒的なパフォーマンスを圧倒的なコストパフォーマンスで実現します。

$0.600 / 1 回
Seedance 2.0 Fast reference-to-video
Reference to VideoDoubao

Seedance 2.0 Fast reference-to-video

Seedance 2.0 Fast(Video-Edit)は、自然言語のプロンプトに基づいて入力動画をより高速かつ低コストで編集できます。ByteDance Seed の統合マルチモーダルアーキテクチャを基盤とし、被写体の同一性、構図、動きを保ちながら、指示に応じてライティング、スタイル、天候、環境、特定の要素を書き換えます。すぐに使える REST API、優れたパフォーマンス、コールドスタートなし、手頃な価格に対応しています。

$0.130 / 1 回