AI モデル API ストア
画像・動画・顔交換のモデル API を閲覧。試してから統一 REST API で統合。
97+ モデル · 従量課金 · チャージクレジットは無期限
Text to Image
19xAI Grok Imagine Image v2.0 テキストから画像生成
xAI Grok Imagine Image V2.0 Text-to-Image は、テキストプロンプトから高品質な画像を生成できます。アスペクト比、解像度、品質を設定でき、クリエイティブ制作、SNS コンテンツ、マーケティング素材、制作ワークフローに適しています。すぐに使える REST 推論 API を提供し、高性能、コールドスタートなし、手頃な価格で利用できます。
Qwen Image 3.0 Pro テキストから画像生成
Qwen Image 3.0 Pro は、優れた画質と高度なプロンプト理解を備えたプロ向けのテキストから画像生成モデルです。最大 2k に対応。すぐに使える REST inference API を提供し、高性能・コールドスタートなし・手頃な価格を実現しています。
OpenAI GPT Image 2 テキストから画像生成
OpenAI の GPT Image 2 テキストから画像生成モデルは、自然言語プロンプトから高品質な画像を生成します。すぐに使える REST 推論 API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
OpenAI GPT Image 2 Edit 画像編集
OpenAI の GPT Image 2 Edit は、自然言語の指示と1枚以上の参照画像を使用して画像編集を可能にします。すぐに使える REST 推論 API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Nami Z-Image T2I Spicy
テキストプロンプトから画像を生成します。幅、高さ、プロンプト最適化、シードを設定できます。
Nano Banana テキストから画像
Gemini 2.5 Flash Image。軽量かつ高速。大量生成やプロトタイピングに最適な、最も手頃なモデル。
Nano Banana Pro テキストから画像
Gemini 3.0 Pro Image。4K 高画質、多言語テキスト描画、プロ仕様のカメラ制御に対応したハイエンドモデル。
Nano Banana Pro テキストから画像
Gemini 3.0 Pro Image。4K 高画質、多言語テキスト描画、プロ仕様のカメラ制御に対応したハイエンドモデル。
Image to Image
17xAI Grok Imagine Image v2.0 画像編集
xAI Grok Imagine Image V2.0 Edit は、テキストによるプロンプトを使って入力画像を編集できるモデルです。解像度と品質を設定でき、精密な画像編集、ビジュアル調整、クリエイティブなバリエーション、SNS コンテンツ、マーケティング素材、制作ワークフローに適しています。すぐに使える REST 推論 API を提供し、高性能・コールドスタートなし・手頃な価格で利用できます。
Qwen Image 3.0 Pro Edit|高速画像編集
Qwen Image 3.0 Pro Edit は、優れた画質と高度な指示理解を備えたプロ向けの画像編集モデルです。最大 2k に対応。すぐに使える REST inference API を提供し、高性能、コールドスタートなし、手頃な価格で利用できます。
ヘッドスワップ(画像)
Swap the head in a photo with the head from a reference image. Upload the target photo first, then the head reference.
Nami Qwen I2I Spicy
自然言語の指示で参照画像を編集し、変更を指定していない部分をできるだけ保持します。
Nano Banana 画像編集
高速・低価格な編集。 マスキング不要で、直感的なオブジェクト置換やスタイル変換が可能。
Nano Banana Pro 画像編集
4K セマンティック編集。自然言語で画像を修正。文脈認識と画像内多言語テキスト編集に対応。
Nano Banana 2 画像編集
4K セマンティック編集。自然言語で画像を修正。文脈認識と画像内多言語テキスト編集に対応。
Seedream V5.0 Pro Edit 画像編集・生成 API
ByteDance の Seedream V5.0 Pro Edit は、単一画像または複数の参照画像をもとに画像の編集・生成を行えます。最大 10 枚の参照画像に対応し、アスペクト比の選択と 1K / 2K の出力階層をサポートしています。すぐに使える REST 推論 API で、高性能、コールドスタートなし、手頃な価格です。
Image to Video
15xAI Grok Imagine Video v1.5 画像から動画
1枚の入力画像とテキストプロンプトから1-15秒の動画を生成します。480pと720pに対応しています。
Vidu Q3 画像から動画へ
Vidu Q3 画像から動画へは、テキストプロンプトを高品質な動画に変換し、優れた視覚的忠実度と多様なモーションを実現します。すぐに使える REST 推論 API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Nami Wan 2.7 I2V Spicy Prime
参照画像とプロンプトから2〜15秒の動画を生成します。720p/1080p出力と任意の音声ガイドに対応します。
MiniMax H3 画像から動画
MiniMax H3 Image to Video は、最初のフレーム画像を自然で一貫性のある 2K 動画にアニメーション化します。自然言語によるモーション指示に対応し、任意の最終フレーム制御によって、動きの一貫性、シーンの連続性、映画のような動画生成を実現します。すぐに使える REST 推論 API を提供し、高性能、コールドスタートなし、手頃な価格で利用できます。
Kling Omni Video O3 画像から動画へ
Kling Omni Video O3( は、MVL(マルチモーダルビジュアルランゲージ)技術を使用して静止画像を動的なシネマティック動画に変換します。被写体の一貫性を保ちながら、自然な動き、物理シミュレーション、シームレスなシーンダイナミクスを追加。音声生成にも対応。すぐに使えるREST API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling Omni Video O1 画像から動画生成
Kling Omni Video O1 画像から動画生成は、MVL(マルチモーダルビジュアル言語)技術を使用して静止画像をダイナミックな映画品質の動画に変換します。自然な動き、物理シミュレーション、シームレスなシーンダイナミクスを追加しながら、被写体の一貫性を維持します。すぐに使えるREST API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling 3.0 Standard 画像から動画へのモデル
Kling 3.0 Standard は、高品質な画像から動画への生成を提供し、スムーズなモーション、映画のようなビジュアル、正確なプロンプトの遵守、共有可能なクリップのためのネイティブ音声を備えています。すぐに使用できる REST 推論 API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling V2.6 画像から動画への API
Kling 2.6 は、滑らかな動き、映画のようなビジュアル、正確なプロンプトの適合性、そして共有可能なクリップ用のネイティブオーディオを備えた、最高レベルの画像から動画生成を提供します。すぐに使用可能な REST 推論 API、優れたパフォーマンス、コールドスタートなし、手頃な価格。
Text to Video
12xAI Grok Imagine Video v1.5 テキストから動画生成
テキストプロンプトから1-15秒の動画を生成します。480p、720p、1080pに対応しています。
MiniMax H3 テキストから動画生成
MiniMax H3 テキストから動画生成は、プロンプトから一貫性のある 2K 動画を生成できます。4〜15秒の柔軟な長さと、6種類のアスペクト比に対応し、シネマティックなシーン、クリエイティブ動画、制作ワークフローに適しています。すぐに使える REST 推論 API を提供し、高性能・コールドスタートなし・手頃な価格で利用できます。
Kling Omni Video O3 標準版テキストから動画生成
Kling Omni Video O3 は、MVL(マルチモーダルビジュアルランゲージ)技術を採用したKuaishouの高度な統合型マルチモーダル動画モデルです。テキストから動画生成モードでは、プロンプトを基に主体の一貫性、自然な物理シミュレーション、正確な意味理解を備えた映画品質の動画を生成します。音声生成にも対応。すぐに使えるREST API、最高のパフォーマンス、冷スタートなし、手頃な価格。
Kling Omni Video O1 テキストから動画生成
Kling Omni Video O1 は、MVL(マルチモーダルビジュアルランゲージ)技術を採用したKuaishou初の統合型マルチモーダル動画モデルです。テキストから動画生成モードでは、プロンプトに基づいて映画品質の動画を生成し、主体の一貫性、自然な物理シミュレーション、正確な意味理解を実現します。すぐに使えるREST API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling 3.0 標準版
Kling 3.0 標準版は、高品質なテキストから動画生成を提供します。滑らかな動き、映画のような映像、正確なプロンプトの適合性、そして共有可能なクリップ用のネイティブ音声を備えています。即時利用可能な REST 推論 API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling V2.6 テキストから動画生成 API
Kling 2.6 は、滑らかなモーション、映画のようなビジュアル、強力なプロンプト適合性、そしてネイティブオーディオを備えた、トップクラスのテキストから動画生成を提供します。共有可能なクリップを即座に生成可能。すぐに使用できる REST 推論 API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Gemini Omni Flash テキストから動画生成 API
Gemini Omni Flash Text to Video は、テキストのプロンプトから音声同期付きの短い AI 動画を生成し、映像生成と音声出力を組み合わせて高速なマルチモーダル動画作成を実現します。すぐに使える REST 推論 API で、高性能、コールドスタートなし、手頃な価格です。
Seedance 2.0 Mini テキストから動画生成
Seedance 2.0 Mini Text to Video は、ByteDance による高速かつ低コストなテキストから動画生成モデルで、シネマティックなマルチショット動画に適しています。テキストのプロンプトから物語性のあるシーケンスを生成し、AI カメラ制御、シーン間で一貫したキャラクター、480P / 720P / 1080P / 4K 出力、4〜15 秒の長さ、柔軟なアスペクト比に対応しています。すぐに使える REST 推論 API を提供し、高性能、コールドスタートなし、手頃な価格が特長です。
Video to Video
8VT Lip Sync 口形同期
VT Lip Sync は、翻訳後の対象動画、翻訳後音声、翻訳後字幕タイミング、および元動画とその元字幕タイミングを使用して、翻訳後動画の口形を同期します。
Kling Omni Video O3
Kling Omni Video O3は、複数の視点からキャラクター、プロップ、またはシーンの参照を使用して創造的な動画を生成します。対象の特徴を抽出し、フレーム間でアイデンティティの一貫性を維持しながら新しい動画コンテンツを作成します。音声生成をサポート。すぐに使える REST API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling Omni Video O3
Kling Omni Video O3は、複数の視点からキャラクター、プロップ、またはシーンの参照を使用して創造的な動画を生成します。対象の特徴を抽出し、フレーム間でアイデンティティの一貫性を維持しながら新しい動画コンテンツを作成します。音声生成をサポート。すぐに使える REST API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling Omni Video O1 リファレンス動画生成
Kling Omni Video O1 リファレンス動画生成は、複数の視点からのキャラクター、小道具、またはシーンのリファレンスを使用してクリエイティブな動画を生成します。被写体の特徴を抽出し、フレーム間でのアイデンティティの一貫性を維持しながら、新しい動画コンテンツを作成します。すぐに使えるREST API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling Omni Video O1 リファレンス動画生成
Kling Omni Video O1 リファレンス動画生成は、複数の視点からのキャラクター、小道具、またはシーンのリファレンスを使用してクリエイティブな動画を生成します。被写体の特徴を抽出し、フレーム間でのアイデンティティの一貫性を維持しながら、新しい動画コンテンツを作成します。すぐに使えるREST API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
Kling 3.0 Standard モーションコントロール
Kling 3.0 Standard モーションコントロールは、参照動画の動きを静止画像に転送してアニメーション化します。キャラクター画像とモーションクリップ(ダンス、アクション、ジェスチャー)をアップロードすると、モデルが動きを抽出して滑らかでリアルな動画を生成します。すぐに使用可能な REST 推論 API、最高のパフォーマンス、コールドスタートなし、手頃な価格。
seedance-2-0 reference-to-video
Seedance 2.0の「リファレンス動画生成」機能は、ビジュアルの統一性を保つ究極のソリューションです。参考素材からアートスタイル、ライティング、構図の意図を正確に抽出。新しく生成される動画に完璧に融合させ、シリーズ作品を通して一貫した世界観を維持します。
Alibaba WAN 2.6
Alibaba WAN 2.6 Reference-to-Video は、キャラクター、小道具、またはシーンの参照画像(単一または複数視点)から、新しいビデオショットを生成します。アイデンティティ、スタイル、レイアウトを忠実に再現しつつ、滑らかで一貫性のある動きを実現。即利用可能な REST 推理 API は、コールドスタートなしの最高性能を誇り、圧倒的なコストパフォーマンスを提供します。
Reference to Video
6xAI Grok Imagine Video v1.5 参照画像から動画
プロンプトと1-7枚の参照画像から1-15秒の動画を生成します。480pと720pに対応しています。
MiniMax H3 参照画像から動画生成
MiniMax H3 Reference to Video は、自然言語のプロンプトと画像・動画・音声を含むマルチモーダルな参照情報から、一貫性のある 2K 動画を生成します。被写体の一貫性、モーション、タイミング、ビジュアルスタイル、シーンの連続性をコントロールできます。すぐに使える REST 推論 API を提供し、高性能・コールドスタートなし・手頃な価格で利用できます。
Gemini Omni Flash 参照画像から動画生成 API
Gemini Omni Flash 参照画像から動画生成は、1枚以上の参照画像とテキストのプロンプトから、音声が同期した短い AI 動画を生成します。視覚的な一貫性を保ちながら、提供された参照内容に従ってガイド付きのマルチモーダル動画生成を行います。すぐに使える REST 推論 API、高性能、コールドスタートなし、手頃な価格。
Seedance 2.0 Mini 参照生成動画
Seedance 2.0 Mini Reference-to-Video(リファレンス画像指定動画生成)は、ByteDance(バイトダンス)が開発した、シネマティックなマルチショット動画の作成に最適な、高速かつ低コストな動画生成モデルです。参考画像とテキストプロンプトを高度に融合させ、ストーリー性豊かな動画セグメントを生成します。AIによる柔軟なカメラワーク制御に対応しているだけでなく、異なるシーン間でのキャラクターの同一性を維持するという課題もクリアしています。480Pから4Kまでのマルチ解像度出力、4〜15秒の動画長、そして自由なアスペクト比をサポート。すぐに使えるREST推論APIが提供されており、コールドスタートなしの圧倒的なパフォーマンスを圧倒的なコストパフォーマンスで実現します。
Seedance 2.5 参照画像/動画から動画生成
Seedance 2.5の「リファレンス動画生成」機能は、ビジュアルの統一性を保つ究極のソリューションです。参考素材からアートスタイル、ライティング、構図の意図を正確に抽出。新しく生成される動画に完璧に融合させ、シリーズ作品を通して一貫した世界観を維持します。
Seedance 2.0 Fast reference-to-video
Seedance 2.0 Fast(Video-Edit)は、自然言語のプロンプトに基づいて入力動画をより高速かつ低コストで編集できます。ByteDance Seed の統合マルチモーダルアーキテクチャを基盤とし、被写体の同一性、構図、動きを保ちながら、指示に応じてライティング、スタイル、天候、環境、特定の要素を書き換えます。すぐに使える REST API、優れたパフォーマンス、コールドスタートなし、手頃な価格に対応しています。
Face Swap
5namifusion 画像/動画 フェイススワップ
NamiFusion ビデオ フェイススワップ モデル 1人または複数人の簡単換顔が可能。複数のmodel_styleスタイルに対応、リアルな結果かワンクリック美顔処理のどちらかを直接出力、自然で綺麗な仕上がり!
换脸
NamiFusion Faceswap v5は、圧倒的なスピードとコストパフォーマンスを誇る顔換えモデルです。肌の色調補正機能を備え、プロ品質を維持しつつ、大規模かつリアルタイムなワークフローに最適化されています。
Image FaceSwap Pro
Image FaceSwap Pro は単一顔の自動検出と、キーポイント対応による複数顔の高精度マッピングに対応します。
namifusion 画像 フェイススワップ
NamiFusion フェイススワップモデル 1人または複数人の簡単換顔が可能。複数のmodel_styleスタイルに対応、リアルな結果かワンクリック美顔処理のどちらかを直接出力、自然で綺麗な仕上がり!
顔検出
入力要素に含まれる顔情報を検出するために使用される顔検出モデル。
Character Swap
4ヘッドスワップ – 生成
Replace selected heads in the video with your reference images using Wan2.2-Animate. Keeps the original audio track.
ヘッドスワップ – 解析
Detect and track heads in a video with SAM3. Returns a head list with preview images and a track manifest for the generate step.
キャラクター置換 – 生成
Replace selected characters in the video with your reference images using Wan2.2-Animate. Keeps the original audio track.
キャラクター置換 – 解析
Detect and track every person in a video with SAM3. Returns a character list with preview images and a track manifest for the generate step.
Text to Speech
4Eleven v3
The most expressive model. Supports 70+ languages. Requires more prompt engineering than our previous models.
Eleven Turbo v2.5
Our high quality, low latency model in 32 languages. Best for developer use cases where speed matters and you need non-English languages.
ElevenLabs Multilingual V2 is a multilingual text-to-speech model
Our most life-like, emotionally rich mode in 29 languages. Best for voice overs, audiobooks, post-production, or any other content creation needs
Eleven Flash v2.5
Our ultra low latency model in 32 languages. Ideal for conversational use cases.
Avatar To Video
2kwaivgi/kling-v2-ai-avatar-standard AIアバター動画生成
Kling AI Avatar は、プロフィール、イントロ、SNS向けコンテンツ用の高品質な AI アバター動画を生成し、クリアなディテールと映画のようなモーションを実現しながら、プロンプトへの高い追従性を提供します。すぐに使える REST 推論 API を備え、高性能、コールドスタートなし、手頃な価格で利用できます。
kwaivgi/kling-v2-ai-avatar-pro AIアバター動画生成
Kling V2 AI Avatar Pro は、高品質な AI アバター動画を生成します。ディテールは鮮明で、動きは安定し、人物の一貫性にも優れているため、プロフィール、イントロ、SNS コンテンツに最適です。すぐに使える REST inference API を提供し、高性能、コールドスタートなし、手頃な価格を実現しています。
Omni Reference
2Wan 3.0 オムニリファレンス
画像・動画・音声・ドキュメント・Webページなど、マルチモーダルな参照入力から最長30秒・音声付きの動画を生成します。参照素材のキャラクター、小道具、空間関係をピクセルレベルで再現し、先頭/末尾フレーム指定による厳密な制御にも対応します。
Wan 3.0 Prime
複数画像・動画・音声などのマルチモーダルな参照入力に対応し、豊かな動きと音声・映像の高い同期性を備えた動画を生成します。参照素材の被写体の外観、動きの特徴、ビジュアルスタイルを忠実に維持し、複数の参照素材を柔軟に組み合わせたコンテンツ制作やショット制御にも対応します。