2026年7月31日,MiniMax正式发布新一代通用全模态视频生成模型 MiniMax H3

image.png

H3可以在同一个上下文中理解文本、图片、视频和音频,并输出最长15秒、2K分辨率、带原生双声道声音的视频。模型还支持已有视频编辑、首尾帧控制、多参考素材生成,以及将参考视频中的动作、镜头和节奏迁移到新角色或场景中。

MiniMax表示,H3面向广告、品牌、电商、产品设计、UI/UX和游戏等商业内容场景。在公司开展的早期测试中,模型重点展示了指令遵循、文字与品牌信息呈现、视频到视频动作迁移等能力。

MiniMax H3目前已经上线官方API,2K视频按每秒0.13美元计费。生成一段完整的15秒2K视频,API成本约为1.95美元。MiniMax称,该价格不到同类主流模型每秒价格的三分之一。

MiniMax H3是什么?

MiniMax H3是一款以视频生成为主要输出形式的通用全模态模型。

它可以统一读取:

  • 自然语言提示词
  • 参考图片
  • 参考视频
  • 参考音频
  • 首帧与尾帧
  • 角色、动作、镜头和风格要求

然后生成包含画面和原生双声道音频的视频结果。官方API文档将其定义为“开放、通用的多模态视频模型”,支持视频生成、参考创作和视频编辑。

这里的“全模态”主要指 输入上下文和理解方式的统一,并不意味着H3可以任意输出Word文档、纯音频、独立图片或长篇文字。

更准确的理解是:

用户可以同时使用文字、图片、视频和音频表达创作意图,H3负责把这些跨模态信息组合成一段新的音视频内容。

最高生成15秒2K视频

根据MiniMax官方API文档,H3当前支持生成:

项目MiniMax H3规格
输出分辨率2K
输出时长4至15秒
时长设置仅支持整数秒
输出音频原生双声道音频
输出比例支持常见比例或自适应
提示词长度最长7000字符
生成方式异步任务

用户可以根据内容类型生成:

  • 4秒产品展示
  • 5秒社交媒体镜头
  • 10秒广告片段
  • 15秒完整创意短片

H3目前还提供768P模式,价格为每秒0.09美元,但官方文档显示该模式仍处于封闭测试阶段,需要联系销售后使用。

15秒2K视频需要多少钱?

MiniMax H3采用按输出时长计费的方式。

2K视频价格

视频时长参考成本
4秒0.52美元
5秒0.65美元
10秒1.30美元
15秒1.95美元
每分钟7.80美元

官方2K价格为每秒0.13美元。

768P视频价格

视频时长参考成本
4秒0.36美元
5秒0.45美元
10秒0.90美元
15秒1.35美元
每分钟5.40美元

768P价格为每秒0.09美元,目前尚未完全开放。

MiniMax称,H3在2K模式下每秒价格不到主流同类模型的三分之一,768P模式价格不到主流720P模型的一半。不过,官方没有在发布材料中列出完整的竞品名称、统一分辨率和计算方法,因此这一比较应视为MiniMax的产品定价口径。

参考素材如何收费?

H3允许用户在一个任务中加入多种参考素材。

官方当前计费规则为:

  • 参考音频:免费
  • 前5张参考图片:免费
  • 超过5张后:每张0.04美元
  • 参考视频:根据视频时长和输出分辨率计费

参考视频在2K任务中按每秒0.13美元计算,在768P任务中按每秒0.09美元计算。

例如,用户提交一段10秒参考视频,并生成一段15秒2K新视频,参考视频和输出视频都会产生相应费用。

因此,多参考视频任务的总成本可能明显高于单纯文生视频。

原生双声道音频意味着什么?

过去不少AI视频工作流采用两个独立步骤:

  1. 视频模型先生成无声画面
  2. 再使用语音、音乐或音效模型补充声音

这种方式容易出现:

  • 人物口型与对白不匹配
  • 脚步和动作节奏不同步
  • 碰撞声音出现时间不准确
  • 环境声和镜头空间不一致
  • 音乐节奏无法跟随画面变化

H3在视频生成过程中同步输出原生双声道声音,使模型可以共同处理:

  • 人物对白
  • 环境声音
  • 动作音效
  • 音乐
  • 镜头节奏
  • 左右声道空间关系

MiniMax官方明确表示,H3生成的视频支持原生立体声输出,而不是只生成单声道语音或后期拼接音轨。

不过,原生音频并不代表所有口型、台词、音乐和物理音效都会完全准确。商业发布前仍应逐段检查发音、版权、音画同步和声音来源。

支持哪些生成模式?

H3 API目前提供三类主要生成模式。

文生视频

只输入文字描述,从零生成视频。

例如:

一台银色智能咖啡机放在极简厨房中,镜头缓慢推进,咖啡液流入玻璃杯,伴随细腻机械声和轻柔背景音乐。

用户还可以在提示词中增加平移、缩放和固定镜头等摄影机控制要求。

首尾帧视频

用户可以提供:

  • 仅首帧
  • 仅尾帧
  • 首帧和尾帧
  • 首尾帧加文字描述

模型会在指定画面之间生成自然运动和转场。

这类能力适合:

  • 产品状态变化
  • 人物成长
  • 场景转场
  • Logo动画
  • 海报动态化
  • 广告镜头衔接

多模态参考生成

用户可以同时提交参考图片、视频和音频,并使用自然语言说明各项素材之间的关系。

例如:

参考视频1的希区柯克式镜头运动,让图片2中的人物演唱音频3中的歌曲,保留图片4的服装风格。

H3会尝试分别提取:

  • 视频中的动作或镜头
  • 图片中的角色或商品
  • 音频中的声音与节奏
  • 提示词中的最终创作目标

再将它们组合成新视频。

单次最多支持多少参考素材?

H3的参考输入限制如下:

素材类型数量限制
参考图片最多9张
参考视频最多3段
参考音频最多3段
混合素材总数最多12个文件
单段视频时长2至15秒
视频总时长不超过15秒
单段音频时长2至15秒
音频总时长不超过15秒

参考音频不能单独提交,必须同时提供图片或视频。

支持的主要格式包括:

  • 图片:JPG、JPEG、PNG、WEBP、HEIC、HEIF
  • 视频:H.264、H.265
  • 视频音频:AAC、MP3
  • 独立音频:WAV、MP3

单个视频文件最大50MB,单张图片最大30MB,单个音频文件最大15MB。

V2V动作迁移是什么?

V2V即Video-to-Video,视频到视频。

用户可以上传一段已有视频,让H3读取其中的:

  • 人物动作
  • 舞蹈节奏
  • 摄影机运动
  • 镜头结构
  • 剪辑节奏
  • 表情变化
  • 场景动态

再将这些信息迁移到另一个角色、商品或视觉风格中。

例如:

  • 把真人舞蹈动作迁移到动画角色
  • 将产品广告镜头迁移到另一款商品
  • 保留摄影机移动,更换人物和场景
  • 将现实视频转换成游戏或插画风格
  • 根据参考视频生成相同节奏的品牌短片

MiniMax将V2V动作迁移列为H3早期测试中的重点优势之一,但当前公开材料主要由厂商案例组成,仍需更多用户和第三方测试验证其在复杂遮挡、多人运动和长动作中的稳定性。

品牌文字和商品信息呈现

AI视频模型在商业应用中经常面临一个问题:画面看起来不错,但品牌名称、包装文字和产品结构发生变化。

MiniMax在H3发布资料中特别强调了:

  • 文字呈现
  • 品牌信息呈现
  • 指令遵循
  • 商品及主体一致性

这些能力对电商和广告非常重要,因为生成画面需要尽可能保留:

  • Logo
  • 包装文字
  • 产品颜色
  • 商品结构
  • 品牌字体
  • 标识位置

MiniMax将这些表现称为“适合商业内容创作”的早期能力,但并未公布大规模商品Logo或文字准确率测试。正式广告仍需逐帧核对,不能直接假设所有品牌文字都能准确生成。

Contextual Omni Representation是什么?

Contextual Omni Representation可以翻译为“上下文全模态表征”。

传统视频模型通常只需要理解一段文字或一张图片。

H3需要同时理解:

  • 目标视频要生成什么
  • 每个参考素材分别承担什么作用
  • 图片、视频和音频之间有什么关系
  • 哪些元素需要保留
  • 哪些动作需要迁移
  • 哪些内容需要修改

MiniMax使用自然语言作为不同模态之间的通用连接与解释方式。

也就是说,用户不需要为“角色参考”“动作参考”“音频参考”和“镜头参考”分别进入不同工具,而是可以通过自然语言描述它们之间的关系。

MiniMax披露,为建立这种全模态表征,团队构建了专门的模型和全模态理解管线。许多原始素材需要约10万Token的推理处理,再被整理成平均约4000 Token的细致描述,用于训练模型理解复杂的音视频关系。

H3-VAE如何降低2K生成成本?

H3重新设计了此前使用的视频Tokenizer,并将新结构命名为H3-VAE。

H3-VAE负责把原始视频和音频压缩成模型能够处理的表示,再将生成结果还原成音视频内容。

MiniMax表示,新Tokenizer在以下方面得到提升:

  • 重建质量
  • 模型学习难度
  • 压缩率
  • 训练效率
  • 推理效率

较高的压缩率带来了约4倍的有效序列长度收益,从而降低训练和推理成本,并为原生2K分辨率提供基础。

这里的“4倍序列长度收益”并不等于视频生成速度直接提高4倍,而是指在相近计算范围内,模型可以更高效地表示和处理音视频序列。

H3-Omni Transformer如何统一不同任务?

以往的视频模型往往为不同任务建立不同模块:

  • 文生视频模型
  • 图生视频模型
  • 主体参考模型
  • 动作迁移模型
  • 风格参考模型
  • 视频编辑模型
  • 配音模型
  • 音效模型

H3尝试在一个通用架构中处理这些任务。

MiniMax表示,在设计H3时,团队甚至放弃了Hailuo 02中部分已经验证有效的架构,因为这些结构会增加任务泛化的复杂度。

H3的目标被概括为两个方向:

  • 通用
  • 高效

由于理解任务和生成任务的计算方式并不完全相同,H3采用理解与生成异构训练架构,分别优化不同工作负载,同时在样本之间进行负载平衡。MiniMax称,这一设计将端到端训练吞吐提高了接近30%。

In-Context Regeneration如何生成2K细节?

不少视频模型采用单独的超分辨率模块,把低分辨率画面放大到2K或4K。

传统超分模块通常只能根据低分辨率画面“猜测”缺失细节。

H3采用的In-Context Regeneration方式,则让基础模型重新读取:

  • 原始提示词
  • 参考图片
  • 参考视频
  • 参考音频
  • 低分辨率生成结果

然后在完整上下文中重新生成高分辨率内容。

这种方式的目标,是让模型在恢复小文字、商品细节和细小结构时,不只依赖低分辨率像素,而是重新利用原始创作上下文。

不过,In-Context Regeneration并不能保证所有小字和Logo完全准确,实际结果仍取决于素材清晰度、镜头距离和文字复杂度。

第三方盲测表现如何?

截至2026年7月31日,Artificial Analysis的Video Arena已经出现H3的早期真人盲测结果。

视频编辑榜

H3在带音频的视频编辑榜中暂列第一:

模型Elo分数样本数
MiniMax H31130约5044
Gemini Omni Flash1121约10185
HappyHorse 1.01096约17762

文生视频榜

在带音频的文生视频榜中,H3以约1242分暂列第二,接近第一名Gemini Omni Flash的1246分,并领先Seedance 2.0 720P。

图生视频榜

在带音频的图生视频榜中,H3以约1185分暂列第三,排在Seedance 2.0和Gemini Omni Flash之后;在不计算音频的图生视频榜中,H3暂列第二。

这些榜单会随着新增投票不断变化,因此只能代表2026年7月31日前后的早期结果。

此外,H3权重尚未正式发布,所以Artificial Analysis当前仍将LTX等模型列为已实际开放权重的视频模型。

H3真的已经开源了吗?

截至2026年7月31日,答案是:还没有正式完成权重发布。

MiniMax官网已经将H3称为“下一代开放权重通用多模态视频模型”,但公司对外宣布的实际计划是,在未来几天内、符合相关法律法规的前提下开放模型权重。

目前可以确认的是:

项目当前状态
H3 API已上线
2K生成已上线
768P生成封闭测试
原生双声道音频已支持
模型权重计划数日内开放
完整技术报告尚未发布
开放许可证尚未公布
本地部署要求尚未公布
参数规模尚未公布

因此,更准确的报道表述应为:

MiniMax已经发布H3并开放API,同时宣布将在未来几天开放模型权重。

不宜在权重下载地址和许可证正式出现前,直接写成“完整开源已经完成”。

为什么视频模型开放权重值得关注?

当前高质量视频生成领域仍以闭源API和在线产品为主。

如果H3按计划开放权重,开发者和企业可能获得以下能力:

  • 自建视频推理服务
  • 私有化部署
  • 行业数据微调
  • 角色和品牌定制
  • 国产芯片适配
  • 推理框架优化
  • 学术研究
  • 社区量化和压缩

MiniMax表示,H3从设计初期便考虑不同AI硬件的兼容性,并希望通过开放权重加快更多硬件平台的适配。

不过,是否真正适合个人本地部署,还需要等待参数规模、显存需求、许可证和推理代码公布。

H3适合哪些商业场景?

广告与品牌营销

可以利用品牌图、产品视频、音乐和文字Brief生成短广告,适合快速测试多个创意方向。

电商商品视频

可将商品图、模特图和参考动作组合成商品展示、上身效果和营销视频。

商品结构、颜色、Logo和文字仍需逐帧核对。

游戏内容

可以生成角色动作、概念动画、技能效果、场景预演和宣传片段。

产品设计

使用草图、产品图片和参考视频制作动态概念展示,帮助团队验证产品叙事和使用场景。

UI/UX展示

可以将静态界面转化为动态产品演示、交互宣传片或应用功能介绍。

短视频与影视预演

支持多参考素材和原生音频,可以用于脚本验证、镜头探索和分镜动态化。

MiniMax将广告、品牌、电商、产品设计、UI/UX和游戏列为H3的主要商业方向。

H3当前还有哪些限制?

单次最长只有15秒

长广告、短剧和完整宣传片仍需要分镜生成和后期剪辑。

权重尚未发布

本地部署、显存要求和许可证仍不明确。

768P仍处于封闭测试

普通API用户目前主要使用2K模式。

多参考输入会增加成本

参考视频同样按照时长计费,大量参考素材可能显著提高单次任务成本。

品牌文字仍需核对

官方强调文字和品牌表现,但没有公布全面文字准确率测试。

多人和复杂动作仍可能出错

遮挡、肢体接触、连续身份和复杂物理关系,仍然是当前视频模型的普遍难点。

榜单成绩会持续变化

Artificial Analysis数据来自动态真人盲测,新模型和新增投票都可能改变排名。

如何通过API使用MiniMax H3?

H3的视频生成采用异步任务流程:

  1. 提交视频生成任务
  2. 获取task_id
  3. 定期查询任务状态
  4. 任务成功后获取视频URL
  5. 下载并保存结果

API模型名称为:

MiniMax-H3

文本、图片、视频和音频通过统一的content数组提交,并使用不同的类型和角色字段区分素材用途。

一个基础文生视频请求需要设置:

  • 模型名称
  • 文字提示词
  • 视频时长
  • 分辨率
  • 画面比例

正式接入时,应将API Key保存在服务端环境变量中,不要直接写入网页或公开代码仓库。

总结

MiniMax H3于2026年7月31日正式发布并上线API。

模型支持统一理解文本、图片、视频和音频上下文,能够生成4至15秒、2K分辨率、带原生双声道音频的视频,并提供文生视频、首尾帧控制、多素材参考和视频编辑等模式。

H3的2K API价格为每秒0.13美元,一段15秒视频约1.95美元。MiniMax称,这一价格不到主流同类产品的三分之一。

在技术层面,H3包含:

  • Contextual Omni Representation
  • H3-VAE
  • H3-Omni Transformer
  • In-Context Regeneration

这些设计分别用于跨模态关系理解、音视频压缩、通用任务建模和2K细节再生成。

Artificial Analysis的早期真人盲测显示,H3暂列带音频视频编辑榜第一、带音频文生视频榜第二,并进入图生视频榜前三。

不过,H3目前尚未真正完成权重开放。MiniMax计划在未来几天内、符合法律法规的前提下发布模型权重,具体参数规模、许可证和本地部署要求仍待公布。

H3真正值得关注的部分,不只是15秒2K或更低价格,而是视频生成模型正在从“输入一句提示词,得到一段画面”,转向:

让用户通过文字、图片、视频和声音共同表达创作意图,再由一个模型完成理解、组合、编辑和音视频输出。

相关链接