AI 模型 API 商店
浏览图像、视频与换脸模型 API。先试玩任意模型,再通过统一 REST API 接入。
97+ 个模型 · 按量付费 · 充值积分永久有效
Text to Image
19xAI Grok Imagine Image v2.0 文生图
xAI Grok Imagine Image V2.0 文生图可根据文本提示词生成高质量图片,并支持配置宽高比、分辨率和质量,适用于创意视觉、社交内容、营销素材和生产工作流。提供开箱即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Qwen Image 3.0 Pro 文生图
Qwen Image 3.0 Pro 是一款专业级文生图模型,具备卓越画质和先进的提示词理解能力。最高支持 2k。提供开箱即用的 REST inference API,性能出色,无冷启动,价格实惠。
OpenAI GPT Image 2 文本生成图片
OpenAI 的 GPT Image 2 文本生成图片模型可根据自然语言提示词生成高质量图片。提供即用型 REST 推理 API,性能最佳,无冷启动,价格实惠。
OpenAI GPT Image 2 Edit 图像编辑
OpenAI 的 GPT Image 2 Edit 可通过自然语言指令结合一张或多张参考图片进行图像编辑。提供即用型 REST 推理 API,性能最佳,无冷启动,价格实惠。
Nami Z-Image T2I Spicy
根据文本提示词生成图片,支持自定义宽高、提示词优化和随机种子。
Nano Banana 文生图
Gemini 2.5 Flash 标准版。轻量极速。兼顾速度与成本,是批量生成与快速原型设计的最佳选择。
Nano Banana Pro 文生图
Gemini 3.0 Pro 旗舰版。专为 4K 原生画质打造,支持图像内多语言文字渲染与专业摄影参数控制。
Nano Banana Pro 文生图
Gemini 3.0 Pro 旗舰版。专为 4K 原生画质打造,支持图像内多语言文字渲染与专业摄影参数控制。
Image to Image
17xAI Grok Imagine Image v2.0 图片编辑
xAI Grok Imagine Image V2.0 Edit 可根据文本提示词对输入图片进行编辑,并支持可配置的分辨率和质量,适用于精细图片编辑、视觉优化、创意变体、社交内容、营销素材和生产工作流。提供开箱即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Qwen Image 3.0 Pro Edit|快速图片编辑
Qwen Image 3.0 Pro Edit 是一款专业级图片编辑模型,具备出色的画质和高级指令理解能力。最高支持 2k。提供开箱即用的 REST inference API,性能优异,无冷启动,价格实惠。
图片换头
将照片中的人物头部替换为参考图中的头部。先上传目标照片,再上传头部参考图。
Nami Qwen I2I Spicy
使用自然语言指令编辑参考图片,并尽量保留未要求修改的内容。
Nano Banana 图像编辑
高性价比智能修图。 无需蒙版即可实现物体替换与风格迁移,极速响应,成本低廉。
Nano Banana Pro 图像编辑
4K 语义级修图。基于自然语言修改现有图像,支持智能光影融合与图像内多语言文字编辑。
Nano Banana 2 图像编辑
4K 语义级修图。基于自然语言修改现有图像,支持智能光影融合与图像内多语言文字编辑。
Seedream V5.0 Pro Edit 图片编辑与生成 API
ByteDance 推出的 Seedream V5.0 Pro Edit 可基于单张图片或多参考图进行图片编辑与生成,最多支持 10 张参考图片,支持宽高比选择以及 1K / 2K 输出档位。开箱即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Image to Video
15xAI Grok Imagine Video v1.5 图片转视频
使用文本提示词将单张输入图片生成 1-15 秒视频,支持 480p 和 720p。
Vidu Q3 图片转视频
Vidu Q3 图片转视频将文本提示词转化为高质量视频,具有卓越的视觉保真度和多样的运动。即用型 REST 推理 API,最佳性能,无冷启动,价格实惠。
Nami Wan 2.7 I2V Spicy Prime
根据参考图片和提示词生成 2–15 秒视频,支持 720p/1080p 输出与可选音频引导。
MiniMax H3 图片转视频
MiniMax H3 图片转视频可将首帧图片动画化为连贯的 2K 视频,支持自然语言运动指令,并可选用末帧控制,以实现一致的运动、场景连贯性和电影感视频生成。提供开箱即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Kling Omni Video O3 图片转视频
Kling Omni Video O3 图片转视频利用MVL(多模态视觉语言)技术将静态图片转化为动态电影级视频。保持主体一致性,同时添加自然运动、物理模拟和无缝场景动态。支持音频生成。即用型REST API,最佳性能,无冷启动,价格实惠。
Kling Omni Video O1 图生视频
Kling Omni Video O1 图生视频使用 MVL(多模态视觉语言)技术将静态图像转换为动态电影级视频。在添加自然运动、物理模拟和无缝场景动态的同时,保持主体一致性。提供即用型 REST API,最佳性能,无冷启动,价格实惠。
Kling 3.0 Standard 图像转视频模型
Kling 3.0 Standard 提供高质量的图像转视频生成,具有流畅的运动、电影级视觉效果、准确的提示词遵循和原生音频,适合分享的剪辑。即用型 REST 推理 API,最佳性能,无冷启动,价格实惠。
Kling V2.6 图片转视频 API
Kling 2.6 提供顶级的图片转视频生成,具有流畅的运动效果、电影级视觉效果、精准的提示词匹配以及原生音频,适合直接分享的短片。即开即用的 REST 推理 API,性能卓越,无冷启动,价格实惠。
Text to Video
12xAI Grok Imagine Video v1.5 文生视频
根据文本提示词生成 1-15 秒视频,支持 480p、720p 和 1080p。
MiniMax H3 文生视频
MiniMax H3 文生视频可根据提示词生成连贯的 2K 视频,支持 4–15 秒灵活时长,以及六种可选宽高比,适用于电影感场景、创意视频和生产工作流。提供开箱即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Kling Omni Video O3 文本生成视频
Kling Omni Video O3 是快手的先进统一多模态视频模型,采用MVL(多模态视觉语言)技术。文本生成视频模式可通过提示词生成具有主体一致性、自然物理模拟和精准语义理解的电影级视频。支持音频生成。即用型REST API,性能卓越,无冷启动,价格实惠。
Kling Omni Video O1 文本生成视频
Kling Omni Video O1 是快手首款统一多模态视频模型,采用 MVL(多模态视觉语言)技术。文本生成视频模式可根据提示词生成电影级视频,具备主体一致性、自然物理模拟和精准语义理解。支持即用型 REST API,性能卓越,无冷启动,价格实惠。
Kling 3.0 Standard
Kling 3.0 标准版提供高质量的文本生成视频功能,具有流畅的运动效果、电影级视觉效果、精准的提示词匹配以及原生音频,适合直接分享的短片。支持即用型 REST 推理 API,性能卓越,无冷启动,价格实惠。
Kling V2.6 文本生成视频 API
Kling 2.6 提供顶级的文本生成视频功能,具有流畅的运动效果、电影级视觉效果、强大的提示词匹配能力,以及原生音频支持,可直接分享视频片段。即用型 REST 推理 API,性能卓越,无冷启动,价格实惠。
Gemini Omni Flash 文生视频 API
Gemini Omni Flash Text to Video 可根据文本提示词生成带同步音频的短篇 AI 视频,结合视觉生成与音频输出,实现快速多模态视频创作。即开即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Seedance 2.0 Mini 文本生成视频
Seedance 2.0 Mini 文本生成视频是字节跳动推出的更快、更低成本的视频生成模型,适合制作电影感多镜头视频。它可根据文本提示词生成叙事视频序列,支持 AI 镜头控制、跨场景角色一致性、480P / 720P / 1080P / 4K 输出、4-15 秒时长以及灵活的宽高比。提供开箱即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Video to Video
8VT 唇形同步
VT 唇形同步通过翻译后的视频、翻译后音频、翻译后字幕时间轴,以及原始视频和原始字幕时间轴,对翻译后的视频进行口型同步。
Kling Omni Video O3
Kling Omni Video O3 参考到视频模型可通过多个视角的角色、道具或场景参考生成创意视频。提取主体特征并创建新的视频内容,同时保持帧间身份一致性。支持音频生成。即用型 REST API,性能最佳,无冷启动,价格实惠。
Kling Omni Video O3
Kling Omni Video O3 参考到视频模型可通过多个视角的角色、道具或场景参考生成创意视频。提取主体特征并创建新的视频内容,同时保持帧间身份一致性。支持音频生成。即用型 REST API,性能最佳,无冷启动,价格实惠。
Kling Omni Video O1 参考视频生成
Kling Omni Video O1 参考视频生成使用多个视角的角色、道具或场景参考来生成创意视频。它提取主体特征并在生成新视频内容的同时保持跨帧的身份一致性。提供即用型 REST API,最佳性能,无冷启动,价格实惠。
Kling Omni Video O1 参考视频生成
Kling Omni Video O1 参考视频生成使用多个视角的角色、道具或场景参考来生成创意视频。它提取主体特征并在生成新视频内容的同时保持跨帧的身份一致性。提供即用型 REST API,最佳性能,无冷启动,价格实惠。
Kling 3.0 Standard 动作控制
Kling 3.0 Standard 动作控制将参考视频中的动作转移到静态图片中进行动画化。上传角色图片和动作片段(舞蹈、动作、手势),模型提取动作生成流畅、逼真的视频。提供即用型 REST 推理 API,性能最佳,无冷启动,价格实惠。
seedance-2-0 reference-to-video
Seedance 2.0 的“参考生视频”功能是视觉统一的终极方案。它能精准提取参考素材的艺术风格、光影基调或构图意向,并将其完美融入新生成的视频中,确保您的系列创作拥有高度一致的视觉语言。
Alibaba WAN 2.6
Alibaba WAN 2.6 Reference-to-Video 能够将角色、道具或场景的参考图(无论是单视角还是多视角)转化为全新的视频片段。它在保持物体特征、风格及布局高度一致的同时,确保了动作的流畅自然。我们提供现成的 REST 推理 API,具备极致性能与零冷启动特性,价格极具竞争力。
Reference to Video
6xAI Grok Imagine Video v1.5 参考图转视频
使用提示词和 1-7 张参考图片生成 1-15 秒视频,支持 480p 和 720p。
MiniMax H3 参考图生视频
MiniMax H3 Reference to Video 可根据自然语言提示词和多模态参考内容生成连贯的 2K 视频,支持图片、视频和音频输入,可引导主体一致性、运动、时序、视觉风格和场景连贯性。提供开箱即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Gemini Omni Flash 参考图生视频 API
Gemini Omni Flash 参考图生视频可根据一张或多张参考图片和文本提示词生成带同步音频的短视频,保持视觉主体一致性,并依据提供的参考内容进行引导式多模态视频生成。即开即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
Seedance 2.0 Mini 参考生视频
Seedance 2.0 Mini 参考图生视频 (Reference-to-Video) 是字节跳动推出的一款高速度、低成本的视频生成模型,专注于创作具有电影质感的多镜头视频。该模型能够完美融合参考图与文本提示词,生成极具叙事感的连续视频片段。它不仅支持灵动的 AI 镜头控制,更攻克了跨场景角色一致性的难题。模型支持从 480P 到 4K 的多分辨率输出,时长跨越 4-15 秒,并适配灵活的宽高比。提供开箱即用的 REST 推理 API,性能卓越,告别冷启动,是极具性价比的专业视频创作利器
Seedance 2.5 参考图/视频转视频
Seedance 2.5 的“参考生视频”功能是视觉统一的终极方案。它能精准提取参考素材的艺术风格、光影基调或构图意向,并将其完美融入新生成的视频中,确保您的系列创作拥有高度一致的视觉语言。
Seedance 2.0 Fast 视频编辑
Seedance 2.0 Fast(reference-to-video)可根据自然语言提示词对输入视频进行编辑,速度更快、成本更低。基于字节跳动 Seed 统一多模态架构构建,在按指令重写光照、风格、天气、环境或特定元素的同时,保留主体身份、构图和运动。提供开箱即用的 REST API,性能出色,无冷启动,价格实惠。
Face Swap
5namifusion 视频换脸
NamiFusion 视频换脸模型 轻松实现单人或多人换脸。兼容多种 model_style 风格,可直接输出真实效果或一键美颜优化结果,换脸自然又好看!
图片换脸V5
NamiFusion Faceswap v5 是兼具极致速度与高性价比的换脸模型,支持智能色调匹配,专为需要高并发、实时处理且追求专业画质的规模化生产而设计。
图片换脸 Pro
Image FaceSwap Pro 支持单人自动检测与多人关键点精确映射。
namifusion 图片换脸
NamiFusion 换脸模型 轻松实现单人或多人换脸。兼容多种 model_style 风格,可直接输出真实效果或一键美颜优化结果,换脸自然又好看!
人脸检测
人脸检测模型, 用于检测输入元素中包含的人脸信息
Character Swap
4换头 – 视频生成
用 Wan2.2-Animate 将视频中选定头部替换为参考图人物头部,保留原始音轨。
换头 – 视频分析
用 SAM3 检测并跟踪视频中的头部,返回头部清单(含预览图)和供 generate 使用的 track manifest。
角色替换 – 视频生成
用 Wan2.2-Animate 将视频中选定人物替换为参考图人物,保留原始音轨。
角色替换 – 视频分析
用 SAM3 检测并跟踪视频中的所有人物,返回人物清单(含预览图)和供 generate 使用的 track manifest。
Text to Speech
4Eleven v3
The most expressive model. Supports 70+ languages. Requires more prompt engineering than our previous models.
Eleven Turbo v2.5
Our high quality, low latency model in 32 languages. Best for developer use cases where speed matters and you need non-English languages.
Eleven Multilingual v2
Our most life-like, emotionally rich mode in 29 languages. Best for voice overs, audiobooks, post-production, or any other content creation needs
Eleven Flash v2.5
Our ultra low latency model in 32 languages. Ideal for conversational use cases.
Avatar To Video
2kwaivgi/kling-v2-ai-avatar-standard AI 数字人视频生成
Kling AI Avatar 可生成高质量的 AI 数字人视频,适用于个人主页、开场介绍和社交内容,呈现干净细节与电影感运动效果,并能稳定遵循提示词。提供开箱即用的 REST 推理 API,性能出色,无冷启动,价格实惠。
kwaivgi/kling-v2-ai-avatar-pro AI 数字人视频生成
Kling V2 AI Avatar Pro 可生成高质量的 AI 数字人视频,细节清晰、动作稳定、人物一致性强,适合用于个人主页、片头和社交媒体内容。提供开箱即用的 REST inference API,性能出色,无冷启动,价格实惠。