MiniMax 发布并开源 H3:一个模型看懂文字图片视频音频,直接生成 2K 有声视频
一句话指挥四种模态的参考素材,2K 单价压到主流的零头,但「开源」开到哪一段,值得看清。
- 丢给它几张图、几段视频、一段音频,一句话说清参考关系就出片,声音是原生立体声,MiniMax 把视频生成做成了「指挥素材」,权重已上 HuggingFace。
- 默认 2K,价钱是对手 1080p 的零头。但「开源」到底开了系统的哪一段,是这次发布最容易看错的地方。
- 中国公司开的源,被挡在门外的反而是欧盟、英国、韩国、美国,中国大陆下载就能用,原因写在他们的许可证里。
一句话指挥图、视频、音频,它自己看懂参考关系
MiniMax 发布了新一代视频生成模型 H3,并放出了权重:一个把文字、图片、视频、音频当成同一套上下文来理解的全模态模型,直接生成带立体声的 2K 视频,最长 15 秒,API 单价不到主流模型的三分之一。
简单来说,过去做 AI 视频要在一堆专用工具里挑:文生视频一个模型、图生视频一个、想控制运镜再换一个。H3 把这些任务全部揉进一个模型,你用一句话说清「参考谁的什么」,它自己看懂素材之间的关系。
官方放的招牌示例,提示词是这么写的:
「参考视频 1 里希区柯克式的运镜,让图 2 里的角色唱歌,人声对上音频 3。」
MiniMax 官方发布示例
下面就是喂给模型的三份素材,和它交出的结果:
单次能塞的参考量:图最多 9 张、视频最多 3 段、音频最多 3 段(音频不能单独当输入,得配着图或视频用),合计不超过 12 个文件。
2K、立体声、广告电商片头海报,官方放的样片都在这
官方样片分两组:一组秀底子(2K 画质、原生立体声),一组秀用途(片头、产品页、海报、广告)。立体声那条建议戴耳机听,声音和画面由同一个模型同时生成,后期不需要再配音。
2K 的价钱不到别家 1080p 的一半
官方价目表明码标价:2K 每秒 0.13 美元,768p 每秒 0.08 美元。发布长文里的说法是「2K 单价不到主流模型的三分之一」,第三方整理的对手价目把这句落成了具体对比:
拿 2K 的分辨率,卖不到对手 1080p 一半的价。便宜和全能出自同一个设计决定。
以前一个任务一个模型,H3 把这堵墙拆了
先看旧世界的格局。图像生成按任务切:文生图、编辑、主体参考、风格参考各是一个专家模型;音频里人声、音效、音乐是三个分开研究的方向;视频切得最碎:文生视频、图生视频、首尾帧、主体参考、运动参考、视频编辑,各占一摊。用户得自己搬素材、串工具;模型也只见过自己那一小块数据,泛化能力被任务边界封了顶。
H3 的第一原则就是拆掉这堵墙:从预训练第一天起,文生图、文生视频、文生音频全部混在一起训练,视频天生带声音出,人声、音效、音乐不分家。「参考」和「编辑」也不再是固定的任务清单,而是用自然语言描述的关系;训练这部分能力的素材全部来自真实自然数据,能随数据规模一直涨。语言,成了任务泛化的那座桥。
四项技术,每一项都在给「任务泛化」打工
① 给素材写描述,写到「关系」这一级
生成模型学本事靠「素材 + 描述」配对。H3 把写描述这件事做到了关系级:不只描述目标视频本身,还要描述参考素材彼此的关系、参考和目标的关系、多镜头下的音画对应关系。官方管它叫 Contextual Omni Representation(上下文全模态表示)。为此专门建了一条理解管线:每条训练素材平均要跑约 10 万 token 的推理(约一部长篇小说的文字量),蒸馏成约 4 千 token 的精确描述。H3 那种「你说什么它都听得懂」的指令跟随能力,根就在这。
② H3-VAE:把视频压缩器整个重写
VAE 相当于视频界的 zip:把视频压成模型算得动的「压缩包」,生成完再解压回画面。压得越狠,模型要算的序列越短、越省钱。H3 把这个 zip 算法整个重写了一遍。
新压缩器空间方向压 16 倍、时间方向压 4 倍,切块进模型后空间等效压缩 32 倍,换来 4 倍的有效序列长度收益,训练和推理成本随之大降,2K 算得起,关键就在这一条。音频侧用同一个压缩器把左右声道各过一遍再合并,立体声是天生的,采样率 32kHz。
③ 生成主体:330 亿参数一个网络,模态不分家
生成主体是一个 330 亿参数的稠密单流 Transformer:注意力层和前馈层完全不区分模态,模态差异只留在输入输出层和 AdaLN 分支,后者是给每一层发「现在在生成什么类型内容」控制信号的旁路参数。33B 里约 13B 落在 AdaLN 分支上,这部分能预先算好缓存起来,推理时不用加载:
模型卡里还有两处工程选择。一是文本和视觉的编码器直接用了阿里开源的 Qwen3-VL-32B 完整预训练权重,取它第 50 层的隐状态喂给生成主体,国产开源模型互相当零件用。二是 Hailuo 02 攒下的架构优势被整个放弃了:那套架构对一个围绕任务泛化设计的模型来说是多余的复杂度,「架构技巧应该给模型定义让路」。训练侧把「理解」和「生成」两种算力负载分开调度,端到端训练吞吐提了近 30%。长序列的稀疏注意力是原生训练的,不过首发只放了全注意力推理,稀疏实现说以后单独放。
④ 2K 是带着原始素材重新生成出来的
传统做法是训一个专门的超分辨率模块,对着 768p 的画面放大,糊掉的小字、细纹理,模块只能靠猜。H3 的 2K 走的是另一条路:让底座模型带着原始参考素材,把自己的 768p 初稿整个重新生成一遍。因为原始上下文还在手上,小字和细节能真的还原出来。这本身又是任务泛化的一个例子:放大,同样只是「生成」的一种。
三段管线只开了中间一段,前处理和 2K 都得调官方 API
完整的 H3 系统是三段管线,这次放出权重的只有中间那段:
逐段说清楚。前段 Context-IR 负责把你的乱序输入,几张图、几段视频、一句话,理解成结构化描述再交给生成模型,「对最终输出质量至关重要」(模型卡原话);它不开源,理由是依赖多阶段工作流和多个托管模型,只提供 API,另外配了两份提示词写作指南,教社区自建这一层。中段 H3-Base 是真开了的部分:两套权重,FL2VA 管文生视频和首尾帧,Ref2VA 管全模态参考,都是 CFG 蒸馏版、BF16 精度,输出 768p。后段 Regenerate-2K「系统复杂,准备好了再放」,现在同样只有 API。
两头 API 的钱也有明码价目:前处理 Context-IR 按 token 计费,输入每百万 token 0.9 美元、输出 3.6 美元;768p 升 2K 的再生成按产出秒数计费,每秒 0.05 美元,原素材还要再算一遍输入费。也就是说,本地跑通 768p 是零 API 成本,想要官方同款 2K,每分钟大约再花 3 美元上下。
部署生态倒是首发就铺满了:SGLang、vLLM、diffusers、ComfyUI 当天全支持,官方示例命令用 4 张 GPU;具体显存门槛官方没给数字。ComfyUI 的原生支持跟权重同一天上线,把 H3 的本事归成五类任务:文生视频、图生视频、首尾帧控制、参考生视频、原位编辑(在已有镜头上改,省掉整段重新生成),工作流模板和教程可以直接下载。
开源许可全球可用,唯独排除欧盟、英国、韩国、美国
权重能下载,不等于随处能用,但方向和很多人的第一反应相反。H3 用的是自家的社区许可证(MiniMax H3 Community License),许可区的写法是「全球,排除以下地区」:欧盟、英国、韩国、美国。也就是说,中国大陆在许可区内,下载就能用;被排除的四地想用权重,要填申请表,由 MiniMax 审核部署场景、确认合规措施后单独授权。
- 含中国大陆
- 下载即用,可微调、可分发
- 需遵守许可证与可接受使用政策
- 欧盟 / 英国 / 韩国 / 美国
- 填官方申请表,审核部署场景与合规措施
- 通过后单独授权使用
排除名单的逻辑:哪里的监管收得紧,哪里就先不给权重。欧盟的 AI 法案已开始执法,英国和韩国有类似的不确定性;美国还多一层,许可证问答里直接点了自己头上的官司:
「在美国,AI 监管仍在快速变化,MiniMax 自身也正卷入专门针对生成式视频 AI 的版权相关法律诉讼。」
MiniMax H3 许可证问答(本站译)
问答收尾给了句承诺:现在的范围反映的是当下的监管现实,「说的是『还没到』,不是『永远不给』」,后续变更会明说、不做静默更新。
技术报告还没出,牛皮先记在账上
三件事在路上:完整技术报告(页面上只有一个「soon」);下一代 H 系列要把自家 M 系列语言模型的能力整合进来;继续扩模型规模、提视觉保真度。厂商也在长文结尾自己列了短板:多模态理解还有很大提升空间,部分场景的视觉细节仍待改进,算是给自己的限定词。
在技术报告和第三方评测出来之前,「可直接商用的生成质量」「指令跟随出色」这些定性,以及价格对比里没点名的「主流模型」,都只有厂商单方面的口径。样片都在上面,可以自己核对。
一句话指挥图、视频、音频,MiniMax H3 直出 2K 有声视频
MiniMax 发布并开源 H3,权重已上 HuggingFace,一页带图讲完它怎么用、多少钱、开源开到哪一段。
↓ 一页读完 · 有一张会动的图
MiniMax 在 7 月 31 日发布了新一代视频生成模型 H3。它把文字、图片、视频、音频四种素材当成同一套上下文来读,直接生成带原生立体声的 2K 视频,最长 15 秒。MiniMax 是做海螺(Hailuo)视频的那家中国公司。
过去做 AI 视频,要在一堆专用模型之间来回搬素材:文生视频一个模型,图生视频一个,想控制运镜再换一个。H3 从预训练第一天起就把这些任务混在一起训练,「参考谁的什么」用自然语言描述,所以说一句话它就能听懂。
运动参考模型 → 导出
配音工具 → 合成
让图 2 里的角色唱歌,
人声对上音频 3
单次能塞的参考量:图最多 9 张、视频最多 3 段、音频最多 3 段(音频得配着图或视频一起用),合计不超过 12 个文件。声音和画面由同一个模型同时生成,后期不用再配音。
输出规格和价目都摆在明面上。
2K 算得起,一半功劳在压缩器:H3 重写了那个把视频压成模型能算的「压缩包」的部件,空间方向压到原来的 1/32,模型要算的东西少了一大截。另一半在放大这一步换了做法。
完整的 H3 系统是三段管线,这次放出权重的只有中间那段。
本地跑通 768p 是零接口成本;想要 MiniMax 同款 2K,前处理按字数计费,再生成每秒 0.05 美元,一分钟成片大约再花 3 美元上下。部署生态首发就铺满了:ComfyUI、vLLM、SGLang、diffusers 当天全支持,示例命令用 4 张 GPU。
权重能下载,不等于随处能用,而方向和很多人的第一反应相反。H3 用的是自家社区许可证,许可区写的是「全球,排除以下地区」。
下载即用
可微调、可再分发
需遵守可接受使用政策
要填官方申请表
MiniMax 审过部署场景与合规措施
通过后才单独授权
许可证问答里给的逻辑:哪里监管收得紧,哪里就先不放权重,欧盟的 AI 法案已开始执法,英国和韩国有类似的不确定性。美国还多一层,问答里直接点了自己头上的官司:MiniMax 正卷入专门针对生成式视频 AI 的版权诉讼。措辞是「还没到,不是永远不给」。
配音再找一个工具。
- × 文生视频 → 导出
- × 运动参考 → 导出
- × 配音合成 → 再导出
只打了一句话。
$20.16 / 分钟
$22.45 / 分钟
2K 那段也没开。
官方同款 2K 走接口。
下载就能用。
包括那四个地方。
开源开的是三段里的中间一段。
