2026年7月31日,MiniMax正式发布新一代通用全模态视频生成模型 MiniMax H3。

H3可以在同一个上下文中理解文本、图片、视频和音频,并输出最长15秒、2K分辨率、带原生双声道声音的视频。模型还支持已有视频编辑、首尾帧控制、多参考素材生成,以及将参考视频中的动作、镜头和节奏迁移到新角色或场景中。
MiniMax表示,H3面向广告、品牌、电商、产品设计、UI/UX和游戏等商业内容场景。在公司开展的早期测试中,模型重点展示了指令遵循、文字与品牌信息呈现、视频到视频动作迁移等能力。
MiniMax H3目前已经上线官方API,2K视频按每秒0.13美元计费。生成一段完整的15秒2K视频,API成本约为1.95美元。MiniMax称,该价格不到同类主流模型每秒价格的三分之一。
MiniMax H3是什么?
MiniMax H3是一款以视频生成为主要输出形式的通用全模态模型。
它可以统一读取:
- 自然语言提示词
- 参考图片
- 参考视频
- 参考音频
- 首帧与尾帧
- 角色、动作、镜头和风格要求
然后生成包含画面和原生双声道音频的视频结果。官方API文档将其定义为“开放、通用的多模态视频模型”,支持视频生成、参考创作和视频编辑。
这里的“全模态”主要指 输入上下文和理解方式的统一,并不意味着H3可以任意输出Word文档、纯音频、独立图片或长篇文字。
更准确的理解是:
用户可以同时使用文字、图片、视频和音频表达创作意图,H3负责把这些跨模态信息组合成一段新的音视频内容。
最高生成15秒2K视频
根据MiniMax官方API文档,H3当前支持生成:
| 项目 | MiniMax H3规格 |
|---|---|
| 输出分辨率 | 2K |
| 输出时长 | 4至15秒 |
| 时长设置 | 仅支持整数秒 |
| 输出音频 | 原生双声道音频 |
| 输出比例 | 支持常见比例或自适应 |
| 提示词长度 | 最长7000字符 |
| 生成方式 | 异步任务 |
用户可以根据内容类型生成:
- 4秒产品展示
- 5秒社交媒体镜头
- 10秒广告片段
- 15秒完整创意短片
H3目前还提供768P模式,价格为每秒0.09美元,但官方文档显示该模式仍处于封闭测试阶段,需要联系销售后使用。
15秒2K视频需要多少钱?
MiniMax H3采用按输出时长计费的方式。
2K视频价格
| 视频时长 | 参考成本 |
| 4秒 | 0.52美元 |
| 5秒 | 0.65美元 |
| 10秒 | 1.30美元 |
| 15秒 | 1.95美元 |
| 每分钟 | 7.80美元 |
官方2K价格为每秒0.13美元。
768P视频价格
| 视频时长 | 参考成本 |
| 4秒 | 0.36美元 |
| 5秒 | 0.45美元 |
| 10秒 | 0.90美元 |
| 15秒 | 1.35美元 |
| 每分钟 | 5.40美元 |
768P价格为每秒0.09美元,目前尚未完全开放。
MiniMax称,H3在2K模式下每秒价格不到主流同类模型的三分之一,768P模式价格不到主流720P模型的一半。不过,官方没有在发布材料中列出完整的竞品名称、统一分辨率和计算方法,因此这一比较应视为MiniMax的产品定价口径。
参考素材如何收费?
H3允许用户在一个任务中加入多种参考素材。
官方当前计费规则为:
- 参考音频:免费
- 前5张参考图片:免费
- 超过5张后:每张0.04美元
- 参考视频:根据视频时长和输出分辨率计费
参考视频在2K任务中按每秒0.13美元计算,在768P任务中按每秒0.09美元计算。
例如,用户提交一段10秒参考视频,并生成一段15秒2K新视频,参考视频和输出视频都会产生相应费用。
因此,多参考视频任务的总成本可能明显高于单纯文生视频。
原生双声道音频意味着什么?
过去不少AI视频工作流采用两个独立步骤:
- 视频模型先生成无声画面
- 再使用语音、音乐或音效模型补充声音
这种方式容易出现:
- 人物口型与对白不匹配
- 脚步和动作节奏不同步
- 碰撞声音出现时间不准确
- 环境声和镜头空间不一致
- 音乐节奏无法跟随画面变化
H3在视频生成过程中同步输出原生双声道声音,使模型可以共同处理:
- 人物对白
- 环境声音
- 动作音效
- 音乐
- 镜头节奏
- 左右声道空间关系
MiniMax官方明确表示,H3生成的视频支持原生立体声输出,而不是只生成单声道语音或后期拼接音轨。
不过,原生音频并不代表所有口型、台词、音乐和物理音效都会完全准确。商业发布前仍应逐段检查发音、版权、音画同步和声音来源。
支持哪些生成模式?
H3 API目前提供三类主要生成模式。
文生视频
只输入文字描述,从零生成视频。
例如:
一台银色智能咖啡机放在极简厨房中,镜头缓慢推进,咖啡液流入玻璃杯,伴随细腻机械声和轻柔背景音乐。
用户还可以在提示词中增加平移、缩放和固定镜头等摄影机控制要求。
首尾帧视频
用户可以提供:
- 仅首帧
- 仅尾帧
- 首帧和尾帧
- 首尾帧加文字描述
模型会在指定画面之间生成自然运动和转场。
这类能力适合:
- 产品状态变化
- 人物成长
- 场景转场
- Logo动画
- 海报动态化
- 广告镜头衔接
多模态参考生成
用户可以同时提交参考图片、视频和音频,并使用自然语言说明各项素材之间的关系。
例如:
参考视频1的希区柯克式镜头运动,让图片2中的人物演唱音频3中的歌曲,保留图片4的服装风格。
H3会尝试分别提取:
- 视频中的动作或镜头
- 图片中的角色或商品
- 音频中的声音与节奏
- 提示词中的最终创作目标
再将它们组合成新视频。
单次最多支持多少参考素材?
H3的参考输入限制如下:
| 素材类型 | 数量限制 |
| 参考图片 | 最多9张 |
| 参考视频 | 最多3段 |
| 参考音频 | 最多3段 |
| 混合素材总数 | 最多12个文件 |
| 单段视频时长 | 2至15秒 |
| 视频总时长 | 不超过15秒 |
| 单段音频时长 | 2至15秒 |
| 音频总时长 | 不超过15秒 |
参考音频不能单独提交,必须同时提供图片或视频。
支持的主要格式包括:
- 图片:JPG、JPEG、PNG、WEBP、HEIC、HEIF
- 视频:H.264、H.265
- 视频音频:AAC、MP3
- 独立音频:WAV、MP3
单个视频文件最大50MB,单张图片最大30MB,单个音频文件最大15MB。
V2V动作迁移是什么?
V2V即Video-to-Video,视频到视频。
用户可以上传一段已有视频,让H3读取其中的:
- 人物动作
- 舞蹈节奏
- 摄影机运动
- 镜头结构
- 剪辑节奏
- 表情变化
- 场景动态
再将这些信息迁移到另一个角色、商品或视觉风格中。
例如:
- 把真人舞蹈动作迁移到动画角色
- 将产品广告镜头迁移到另一款商品
- 保留摄影机移动,更换人物和场景
- 将现实视频转换成游戏或插画风格
- 根据参考视频生成相同节奏的品牌短片
MiniMax将V2V动作迁移列为H3早期测试中的重点优势之一,但当前公开材料主要由厂商案例组成,仍需更多用户和第三方测试验证其在复杂遮挡、多人运动和长动作中的稳定性。
品牌文字和商品信息呈现
AI视频模型在商业应用中经常面临一个问题:画面看起来不错,但品牌名称、包装文字和产品结构发生变化。
MiniMax在H3发布资料中特别强调了:
- 文字呈现
- 品牌信息呈现
- 指令遵循
- 商品及主体一致性
这些能力对电商和广告非常重要,因为生成画面需要尽可能保留:
- Logo
- 包装文字
- 产品颜色
- 商品结构
- 品牌字体
- 标识位置
MiniMax将这些表现称为“适合商业内容创作”的早期能力,但并未公布大规模商品Logo或文字准确率测试。正式广告仍需逐帧核对,不能直接假设所有品牌文字都能准确生成。
Contextual Omni Representation是什么?
Contextual Omni Representation可以翻译为“上下文全模态表征”。
传统视频模型通常只需要理解一段文字或一张图片。
H3需要同时理解:
- 目标视频要生成什么
- 每个参考素材分别承担什么作用
- 图片、视频和音频之间有什么关系
- 哪些元素需要保留
- 哪些动作需要迁移
- 哪些内容需要修改
MiniMax使用自然语言作为不同模态之间的通用连接与解释方式。
也就是说,用户不需要为“角色参考”“动作参考”“音频参考”和“镜头参考”分别进入不同工具,而是可以通过自然语言描述它们之间的关系。
MiniMax披露,为建立这种全模态表征,团队构建了专门的模型和全模态理解管线。许多原始素材需要约10万Token的推理处理,再被整理成平均约4000 Token的细致描述,用于训练模型理解复杂的音视频关系。
H3-VAE如何降低2K生成成本?
H3重新设计了此前使用的视频Tokenizer,并将新结构命名为H3-VAE。
H3-VAE负责把原始视频和音频压缩成模型能够处理的表示,再将生成结果还原成音视频内容。
MiniMax表示,新Tokenizer在以下方面得到提升:
- 重建质量
- 模型学习难度
- 压缩率
- 训练效率
- 推理效率
较高的压缩率带来了约4倍的有效序列长度收益,从而降低训练和推理成本,并为原生2K分辨率提供基础。
这里的“4倍序列长度收益”并不等于视频生成速度直接提高4倍,而是指在相近计算范围内,模型可以更高效地表示和处理音视频序列。
H3-Omni Transformer如何统一不同任务?
以往的视频模型往往为不同任务建立不同模块:
- 文生视频模型
- 图生视频模型
- 主体参考模型
- 动作迁移模型
- 风格参考模型
- 视频编辑模型
- 配音模型
- 音效模型
H3尝试在一个通用架构中处理这些任务。
MiniMax表示,在设计H3时,团队甚至放弃了Hailuo 02中部分已经验证有效的架构,因为这些结构会增加任务泛化的复杂度。
H3的目标被概括为两个方向:
- 通用
- 高效
由于理解任务和生成任务的计算方式并不完全相同,H3采用理解与生成异构训练架构,分别优化不同工作负载,同时在样本之间进行负载平衡。MiniMax称,这一设计将端到端训练吞吐提高了接近30%。
In-Context Regeneration如何生成2K细节?
不少视频模型采用单独的超分辨率模块,把低分辨率画面放大到2K或4K。
传统超分模块通常只能根据低分辨率画面“猜测”缺失细节。
H3采用的In-Context Regeneration方式,则让基础模型重新读取:
- 原始提示词
- 参考图片
- 参考视频
- 参考音频
- 低分辨率生成结果
然后在完整上下文中重新生成高分辨率内容。
这种方式的目标,是让模型在恢复小文字、商品细节和细小结构时,不只依赖低分辨率像素,而是重新利用原始创作上下文。
不过,In-Context Regeneration并不能保证所有小字和Logo完全准确,实际结果仍取决于素材清晰度、镜头距离和文字复杂度。
第三方盲测表现如何?
截至2026年7月31日,Artificial Analysis的Video Arena已经出现H3的早期真人盲测结果。
视频编辑榜
H3在带音频的视频编辑榜中暂列第一:
| 模型 | Elo分数 | 样本数 |
| MiniMax H3 | 1130 | 约5044 |
| Gemini Omni Flash | 1121 | 约10185 |
| HappyHorse 1.0 | 1096 | 约17762 |
文生视频榜
在带音频的文生视频榜中,H3以约1242分暂列第二,接近第一名Gemini Omni Flash的1246分,并领先Seedance 2.0 720P。
图生视频榜
在带音频的图生视频榜中,H3以约1185分暂列第三,排在Seedance 2.0和Gemini Omni Flash之后;在不计算音频的图生视频榜中,H3暂列第二。
这些榜单会随着新增投票不断变化,因此只能代表2026年7月31日前后的早期结果。
此外,H3权重尚未正式发布,所以Artificial Analysis当前仍将LTX等模型列为已实际开放权重的视频模型。
H3真的已经开源了吗?
截至2026年7月31日,答案是:还没有正式完成权重发布。
MiniMax官网已经将H3称为“下一代开放权重通用多模态视频模型”,但公司对外宣布的实际计划是,在未来几天内、符合相关法律法规的前提下开放模型权重。
目前可以确认的是:
| 项目 | 当前状态 |
| H3 API | 已上线 |
| 2K生成 | 已上线 |
| 768P生成 | 封闭测试 |
| 原生双声道音频 | 已支持 |
| 模型权重 | 计划数日内开放 |
| 完整技术报告 | 尚未发布 |
| 开放许可证 | 尚未公布 |
| 本地部署要求 | 尚未公布 |
| 参数规模 | 尚未公布 |
因此,更准确的报道表述应为:
MiniMax已经发布H3并开放API,同时宣布将在未来几天开放模型权重。
不宜在权重下载地址和许可证正式出现前,直接写成“完整开源已经完成”。
为什么视频模型开放权重值得关注?
当前高质量视频生成领域仍以闭源API和在线产品为主。
如果H3按计划开放权重,开发者和企业可能获得以下能力:
- 自建视频推理服务
- 私有化部署
- 行业数据微调
- 角色和品牌定制
- 国产芯片适配
- 推理框架优化
- 学术研究
- 社区量化和压缩
MiniMax表示,H3从设计初期便考虑不同AI硬件的兼容性,并希望通过开放权重加快更多硬件平台的适配。
不过,是否真正适合个人本地部署,还需要等待参数规模、显存需求、许可证和推理代码公布。
H3适合哪些商业场景?
广告与品牌营销
可以利用品牌图、产品视频、音乐和文字Brief生成短广告,适合快速测试多个创意方向。
电商商品视频
可将商品图、模特图和参考动作组合成商品展示、上身效果和营销视频。
商品结构、颜色、Logo和文字仍需逐帧核对。
游戏内容
可以生成角色动作、概念动画、技能效果、场景预演和宣传片段。
产品设计
使用草图、产品图片和参考视频制作动态概念展示,帮助团队验证产品叙事和使用场景。
UI/UX展示
可以将静态界面转化为动态产品演示、交互宣传片或应用功能介绍。
短视频与影视预演
支持多参考素材和原生音频,可以用于脚本验证、镜头探索和分镜动态化。
MiniMax将广告、品牌、电商、产品设计、UI/UX和游戏列为H3的主要商业方向。
H3当前还有哪些限制?
单次最长只有15秒
长广告、短剧和完整宣传片仍需要分镜生成和后期剪辑。
权重尚未发布
本地部署、显存要求和许可证仍不明确。
768P仍处于封闭测试
普通API用户目前主要使用2K模式。
多参考输入会增加成本
参考视频同样按照时长计费,大量参考素材可能显著提高单次任务成本。
品牌文字仍需核对
官方强调文字和品牌表现,但没有公布全面文字准确率测试。
多人和复杂动作仍可能出错
遮挡、肢体接触、连续身份和复杂物理关系,仍然是当前视频模型的普遍难点。
榜单成绩会持续变化
Artificial Analysis数据来自动态真人盲测,新模型和新增投票都可能改变排名。
如何通过API使用MiniMax H3?
H3的视频生成采用异步任务流程:
- 提交视频生成任务
- 获取
task_id - 定期查询任务状态
- 任务成功后获取视频URL
- 下载并保存结果
API模型名称为:
MiniMax-H3文本、图片、视频和音频通过统一的content数组提交,并使用不同的类型和角色字段区分素材用途。
一个基础文生视频请求需要设置:
- 模型名称
- 文字提示词
- 视频时长
- 分辨率
- 画面比例
正式接入时,应将API Key保存在服务端环境变量中,不要直接写入网页或公开代码仓库。
总结
MiniMax H3于2026年7月31日正式发布并上线API。
模型支持统一理解文本、图片、视频和音频上下文,能够生成4至15秒、2K分辨率、带原生双声道音频的视频,并提供文生视频、首尾帧控制、多素材参考和视频编辑等模式。
H3的2K API价格为每秒0.13美元,一段15秒视频约1.95美元。MiniMax称,这一价格不到主流同类产品的三分之一。
在技术层面,H3包含:
- Contextual Omni Representation
- H3-VAE
- H3-Omni Transformer
- In-Context Regeneration
这些设计分别用于跨模态关系理解、音视频压缩、通用任务建模和2K细节再生成。
Artificial Analysis的早期真人盲测显示,H3暂列带音频视频编辑榜第一、带音频文生视频榜第二,并进入图生视频榜前三。
不过,H3目前尚未真正完成权重开放。MiniMax计划在未来几天内、符合法律法规的前提下发布模型权重,具体参数规模、许可证和本地部署要求仍待公布。
H3真正值得关注的部分,不只是15秒2K或更低价格,而是视频生成模型正在从“输入一句提示词,得到一段画面”,转向:
让用户通过文字、图片、视频和声音共同表达创作意图,再由一个模型完成理解、组合、编辑和音视频输出。










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。