MiniMax H3 于 7 月 31 日发布并开放 API,可统一接收文字、图片、视频与音频参考,输出 4 至 15 秒的 2K 双声道音视频。2K 视频按 0.80 元/秒计费,开发者可通过同一个 V2 接口完成文生视频、首尾帧控制和多模态参考生成。
一个模型接收四种素材
MiniMax H3 是面向视频创作的多模态生成模型。它把文字提示词、图片、视频和音频放进同一个上下文中处理,最终输出带原生双声道声音的视频。当前 API 输出分辨率为 2K,时长可以选择 4 至 15 秒的整数值。
这套输入方式解决的是“参考关系”问题。用户可以用一张图片指定人物或画面,用一段视频提供动作、镜头或剪辑节奏,再用音频提供声音参考,最后通过文字说明这些素材如何组合。模型的任务不只是从一句提示词生成画面,也包括首尾帧控制和利用现有素材生成新视频。
H3 提供三类生成方式:
- 文生视频只需要文字提示词,可以选择
21:9、16:9、4:3、1:1、3:4或9:16; - 首帧或尾帧图生视频用一至两张图片控制开头和结尾,画面比例随输入图片确定;
- 多模态参考生成可以组合参考图片、视频与音频,并允许指定输出比例或使用自适应比例。
一次最多放入 12 个参考文件
全能参考模式最多接收 9 张图片、3 段视频和 3 段音频,混合输入的总数不能超过 12 个文件。每段参考视频和音频的时长为 2 至 15 秒,同类素材的总时长也不能超过 15 秒。音频不能单独作为参考,至少还要搭配一张图片或一段视频。
图片支持 JPG、JPEG、PNG、WEBP、HEIC 和 HEIF;视频支持 MP4、MOV,编码可使用 H.264/AVC 或 H.265/HEVC;音频支持 WAV 与 MP3。单张图片、单段视频和单段音频的大小上限分别为 30 MB、50 MB 和 15 MB。API 请求体上限为 64 MB,因此较大的素材更适合使用公网 URL 或平台文件地址传入。
所有请求都必须包含一条非空文字提示词,单条提示词最多 7000 个字符。首尾帧模式与多模态参考模式不能混用:如果已经使用参考图片、参考视频或参考音频,就不能再把另一张图片标记为首帧或尾帧。
API 采用异步任务流程
开发者需要先在 MiniMax 开放平台创建 API Key,然后向 POST /v2/video_generation 提交任务。请求中的模型名称为 MiniMax-H3,多种素材统一放在 content 数组中,并通过 text、image_url、video_url 和 audio_url 区分类型。
接口创建成功后会返回 task_id。生成视频需要时间,程序再用任务 ID 查询状态;任务完成后,响应中的 content.url 会给出成片下载地址。这个流程适合放进自己的视频工具、内容生产系统或批处理工作流,不要求调用方持续保持一条长连接。
15 秒 2K 视频刊例价为 12 元
H3 的 2K 输出按 0.80 元/秒计费。生成 5 秒视频的刊例价是 4 元,生成 15 秒视频是 12 元,输入素材费用另算。
参考音频不收费;参考图片前 5 张免费,超出部分按 0.20 元/张收费。参考视频按照输入视频时长和生成分辨率计费,2K 为 0.80 元/秒。768P 输出的刊例价为 0.50 元/秒,该规格当前通过联系销售申请使用。
对只靠文字或少量图片生成短视频的用户,费用主要由成片时长决定。使用多段参考视频时,还需要把输入视频的时长费用一并计入预算。


