产品发布 · 小互解读

MiniMax 发布并开源 H3:一个模型看懂文字图片视频音频,直接生成 2K 有声视频

一句话指挥四种模态的参考素材,2K 单价压到主流的零头,但「开源」开到哪一段,值得看清。

一分钟速览
  • 丢给它几张图、几段视频、一段音频,一句话说清参考关系就出片,声音是原生立体声,MiniMax 把视频生成做成了「指挥素材」,权重已上 HuggingFace。
  • 默认 2K,价钱是对手 1080p 的零头。但「开源」到底开了系统的哪一段,是这次发布最容易看错的地方。
  • 中国公司开的源,被挡在门外的反而是欧盟、英国、韩国、美国,中国大陆下载就能用,原因写在他们的许可证里。
⚑ 素材来自 MiniMax 官方发布、HuggingFace 模型卡与许可证原文,效果说法均为厂商口径;完整技术报告尚未发布,暂无第三方评测。H3 自家价格取自官方按量付费价目,对手价格对比来自第三方整理,出处见文末。
这是什么

一句话指挥图、视频、音频,它自己看懂参考关系

MiniMax 发布了新一代视频生成模型 H3,并放出了权重:一个把文字、图片、视频、音频当成同一套上下文来理解的全模态模型,直接生成带立体声的 2K 视频,最长 15 秒,API 单价不到主流模型的三分之一。

简单来说,过去做 AI 视频要在一堆专用工具里挑:文生视频一个模型、图生视频一个、想控制运镜再换一个。H3 把这些任务全部揉进一个模型,你用一句话说清「参考谁的什么」,它自己看懂素材之间的关系。

官方放的招牌示例,提示词是这么写的:

「参考视频 1 里希区柯克式的运镜,让图 2 里的角色唱歌,人声对上音频 3。」

MiniMax 官方发布示例

下面就是喂给模型的三份素材,和它交出的结果:

参考素材 1:提供运镜方式的视频(希区柯克式变焦)。来源:MiniMax
参考素材 2:角色图
参考素材 2:要「开口唱歌」的角色图。来源:MiniMax
参考素材 3:人声音频,生成视频里的歌声要对上它。来源:MiniMax
生成结果:图 2 的角色开口唱歌,人声对上音频 3,镜头做出了视频 1 的运镜。三种模态的参考关系全靠那一句话交代。来源:MiniMax

单次能塞的参考量:图最多 9 张、视频最多 3 段、音频最多 3 段(音频不能单独当输入,得配着图或视频用),合计不超过 12 个文件。

站内 · 同一条赛道的对手
字节跳动发布 Seedance 2.5:单次 30 秒直出,一条指令能同时指挥 50 个参考素材
「指挥素材」这条路字节也在抢,两家的玩法可以对照着看。
样片

2K、立体声、广告电商片头海报,官方放的样片都在这

官方样片分两组:一组秀底子(2K 画质、原生立体声),一组秀用途(片头、产品页、海报、广告)。立体声那条建议戴耳机听,声音和画面由同一个模型同时生成,后期不需要再配音。

官方 2K 画质样片。平台 API 默认输出 2K;开源版底座自己跑只到 768p,2K 要经官方的再生成模块(后面「开源」一节拆这件事)。来源:MiniMax
原生立体声样片:左右声道跟着画面里的空间关系走。来源:MiniMax
用例样片:电影片头。来源:MiniMax
用例样片:产品网站宣传片。来源:MiniMax
用例样片:动态海报。来源:MiniMax
用例样片:广告与电商。官方主打的商用场景还包括品牌、产品设计、UI/UX 和游戏。来源:MiniMax
4–15 秒
单次输出时长
2K
平台 API 默认分辨率
24 fps
输出帧率
32kHz
立体声音频
11 种
对白稳定支持的语言
21:9–9:16
画幅比例范围
价格

2K 的价钱不到别家 1080p 的一半

官方价目表明码标价:2K 每秒 0.13 美元,768p 每秒 0.08 美元。发布长文里的说法是「2K 单价不到主流模型的三分之一」,第三方整理的对手价目把这句落成了具体对比:

MiniMax H3 · 2K$7.8/分钟
Kling 3.0 · 1080p$20.16/分钟
Seedance 2.0 · 1080p$22.45/分钟
按每秒单价折算成每分钟。H3 两档(2K $0.13/秒、768p $0.08/秒)是官方按量付费价目(platform.minimax.io,2026-08-03 查证);Kling 与 Seedance 的数字来自第三方整理(2026 年 8 月),官方没点名「主流模型」是谁。

拿 2K 的分辨率,卖不到对手 1080p 一半的价。便宜和全能出自同一个设计决定。

设计哲学

以前一个任务一个模型,H3 把这堵墙拆了

先看旧世界的格局。图像生成按任务切:文生图、编辑、主体参考、风格参考各是一个专家模型;音频里人声、音效、音乐是三个分开研究的方向;视频切得最碎:文生视频、图生视频、首尾帧、主体参考、运动参考、视频编辑,各占一摊。用户得自己搬素材、串工具;模型也只见过自己那一小块数据,泛化能力被任务边界封了顶。

H3 的第一原则就是拆掉这堵墙:从预训练第一天起,文生图、文生视频、文生音频全部混在一起训练,视频天生带声音出,人声、音效、音乐不分家。「参考」和「编辑」也不再是固定的任务清单,而是用自然语言描述的关系;训练这部分能力的素材全部来自真实自然数据,能随数据规模一直涨。语言,成了任务泛化的那座桥。

过去:一个任务一个专家模型 文生视频 图生视频 首尾帧生成 主体参考 运动参考 视频编辑 人声 · 音效 音乐生成 现在:全任务混在一起训练 H3 一个模型音画同出 · 参考关系用语言描述 「参考视频 1 的运镜,让图 2 的角色唱歌,人声用音频 3」,指令代替任务清单
过去按任务切成专家模型,H3 从预训练起全任务混训,「参考谁的什么」用自然语言说。本站示意图。
机制

四项技术,每一项都在给「任务泛化」打工

① 给素材写描述,写到「关系」这一级

生成模型学本事靠「素材 + 描述」配对。H3 把写描述这件事做到了关系级:不只描述目标视频本身,还要描述参考素材彼此的关系、参考和目标的关系、多镜头下的音画对应关系。官方管它叫 Contextual Omni Representation(上下文全模态表示)。为此专门建了一条理解管线:每条训练素材平均要跑约 10 万 token 的推理(约一部长篇小说的文字量),蒸馏成约 4 千 token 的精确描述。H3 那种「你说什么它都听得懂」的指令跟随能力,根就在这。

每条素材的理解推理 约 10 万 token 蒸馏后的精确描述 约 4 千 token,只剩 1/25
一部长篇小说体量的推理,压成几页纸的关系级描述,再拿去教模型。本站示意图。

② H3-VAE:把视频压缩器整个重写

打个比方

VAE 相当于视频界的 zip:把视频压成模型算得动的「压缩包」,生成完再解压回画面。压得越狠,模型要算的序列越短、越省钱。H3 把这个 zip 算法整个重写了一遍。

新压缩器空间方向压 16 倍、时间方向压 4 倍,切块进模型后空间等效压缩 32 倍,换来 4 倍的有效序列长度收益,训练和推理成本随之大降,2K 算得起,关键就在这一条。音频侧用同一个压缩器把左右声道各过一遍再合并,立体声是天生的,采样率 32kHz。

③ 生成主体:330 亿参数一个网络,模态不分家

生成主体是一个 330 亿参数的稠密单流 Transformer:注意力层和前馈层完全不区分模态,模态差异只留在输入输出层和 AdaLN 分支,后者是给每一层发「现在在生成什么类型内容」控制信号的旁路参数。33B 里约 13B 落在 AdaLN 分支上,这部分能预先算好缓存起来,推理时不用加载:

推理要扛的 ≈20B
AdaLN ≈13B · 可缓存不加载
33B 参数的构成:推理部署时实际负担约 20B。官方放出的是完整 33B 权重,方便微调。

模型卡里还有两处工程选择。一是文本和视觉的编码器直接用了阿里开源的 Qwen3-VL-32B 完整预训练权重,取它第 50 层的隐状态喂给生成主体,国产开源模型互相当零件用。二是 Hailuo 02 攒下的架构优势被整个放弃了:那套架构对一个围绕任务泛化设计的模型来说是多余的复杂度,「架构技巧应该给模型定义让路」。训练侧把「理解」和「生成」两种算力负载分开调度,端到端训练吞吐提了近 30%。长序列的稀疏注意力是原生训练的,不过首发只放了全注意力推理,稀疏实现说以后单独放。

H3-Base 架构图
H3-Base 官方架构图:文字走 H3-Encoder(Qwen3-VL-32B),画面同时过编码器和视觉 VAE,声音走音频 VAE,全部打包成一条序列进 Omni Transformer,出口分别解码成视频和立体声。来源:HuggingFace 模型卡

④ 2K 是带着原始素材重新生成出来的

传统做法是训一个专门的超分辨率模块,对着 768p 的画面放大,糊掉的小字、细纹理,模块只能靠猜。H3 的 2K 走的是另一条路:让底座模型带着原始参考素材,把自己的 768p 初稿整个重新生成一遍。因为原始上下文还在手上,小字和细节能真的还原出来。这本身又是任务泛化的一个例子:放大,同样只是「生成」的一种。

传统超分路线 768p 初稿 超分模块 放大成品 · 细节靠猜 H3 · In-Context Regeneration 768p 初稿 原始参考素材也一起带上 底座重新生成一遍 2K 成品小字、细节真还原
超分对着糊图猜;H3 带着原始素材重新生成,细节从上下文里来。本站示意图。
开源边界

三段管线只开了中间一段,前处理和 2K 都得调官方 API

完整的 H3 系统是三段管线,这次放出权重的只有中间那段:

H3-Context-IR前处理 · 理解输入官方称对质量至关重要仅 API · 未开源 H3-Base生成 768p 音视频FL2VA + Ref2VA 两套权重权重已开 · 可下载 H3-Regenerate-2K带上下文重生成 2K官方称「以后放」仅 API · 未开源 ↑ 调官方 API ↑ 本地自己跑 ↑ 调官方 API 本地复现官方 2K 效果 = 中段自己部署,两头仍要官方接口 另:原生稀疏注意力的实现也未随首发放出,官方称将单独发布
H3 三段管线的开源边界。依据 HuggingFace 模型卡绘制,本站示意图。
H3-Context-IR前处理 · 理解输入 · 对质量至关重要仅 API · 未开源↓ 调官方 API H3-Base生成 768p 音视频 · FL2VA + Ref2VA权重已开 · 可下载↓ 本地自己跑 H3-Regenerate-2K带上下文重生成 2K · 「以后放」仅 API · 未开源↓ 调官方 API 本地复现官方 2K = 中段自己部署两头仍要官方接口另:稀疏注意力实现未随首发放出
H3 三段管线的开源边界。依据 HuggingFace 模型卡绘制,本站示意图。

逐段说清楚。前段 Context-IR 负责把你的乱序输入,几张图、几段视频、一句话,理解成结构化描述再交给生成模型,「对最终输出质量至关重要」(模型卡原话);它不开源,理由是依赖多阶段工作流和多个托管模型,只提供 API,另外配了两份提示词写作指南,教社区自建这一层。中段 H3-Base 是真开了的部分:两套权重,FL2VA 管文生视频和首尾帧,Ref2VA 管全模态参考,都是 CFG 蒸馏版、BF16 精度,输出 768p。后段 Regenerate-2K「系统复杂,准备好了再放」,现在同样只有 API。

两头 API 的钱也有明码价目:前处理 Context-IR 按 token 计费,输入每百万 token 0.9 美元、输出 3.6 美元;768p 升 2K 的再生成按产出秒数计费,每秒 0.05 美元,原素材还要再算一遍输入费。也就是说,本地跑通 768p 是零 API 成本,想要官方同款 2K,每分钟大约再花 3 美元上下。

部署生态倒是首发就铺满了:SGLang、vLLM、diffusers、ComfyUI 当天全支持,官方示例命令用 4 张 GPU;具体显存门槛官方没给数字。ComfyUI 的原生支持跟权重同一天上线,把 H3 的本事归成五类任务:文生视频、图生视频、首尾帧控制、参考生视频、原位编辑(在已有镜头上改,省掉整段重新生成),工作流模板和教程可以直接下载。

ComfyUI 官方演示:H3 权重放出当天即获原生支持,五类视频任务共用这一个模型。来源:ComfyUI
H3 系统总览图
官方系统总览图:Context-IR、H3-Base、Regenerate-2K 三个模块的分工。来源:HuggingFace 模型卡
许可

开源许可全球可用,唯独排除欧盟、英国、韩国、美国

权重能下载,不等于随处能用,但方向和很多人的第一反应相反。H3 用的是自家的社区许可证(MiniMax H3 Community License),许可区的写法是「全球,排除以下地区」:欧盟、英国、韩国、美国。也就是说,中国大陆在许可区内,下载就能用;被排除的四地想用权重,要填申请表,由 MiniMax 审核部署场景、确认合规措施后单独授权。

✓ 许可区:全球其余地区
  • 含中国大陆
  • 下载即用,可微调、可分发
  • 需遵守许可证与可接受使用政策
被排除的四地
  • 欧盟 / 英国 / 韩国 / 美国
  • 填官方申请表,审核部署场景与合规措施
  • 通过后单独授权使用
API 不受此限制,全球可用(含这四地)。

排除名单的逻辑:哪里的监管收得紧,哪里就先不给权重。欧盟的 AI 法案已开始执法,英国和韩国有类似的不确定性;美国还多一层,许可证问答里直接点了自己头上的官司:

「在美国,AI 监管仍在快速变化,MiniMax 自身也正卷入专门针对生成式视频 AI 的版权相关法律诉讼。」

MiniMax H3 许可证问答(本站译)

问答收尾给了句承诺:现在的范围反映的是当下的监管现实,「说的是『还没到』,不是『永远不给』」,后续变更会明说、不做静默更新。

下一步

技术报告还没出,牛皮先记在账上

三件事在路上:完整技术报告(页面上只有一个「soon」);下一代 H 系列要把自家 M 系列语言模型的能力整合进来;继续扩模型规模、提视觉保真度。厂商也在长文结尾自己列了短板:多模态理解还有很大提升空间,部分场景的视觉细节仍待改进,算是给自己的限定词。

在技术报告和第三方评测出来之前,「可直接商用的生成质量」「指令跟随出色」这些定性,以及价格对比里没点名的「主流模型」,都只有厂商单方面的口径。样片都在上面,可以自己核对。

🧰 上手卡 · MiniMax H3
价格网页版可试用;API 官方价 2K $0.13/秒、768p $0.08/秒
门槛网页版零门槛;本地部署只有 768p 底座,官方示例用 4 张 GPU
来源
MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and ModalitiesMiniMax·官方发布·2026-07-31
本站说明
样片、示例素材与两张架构图均来自 MiniMax 官方发布及 HuggingFace 模型卡;三段管线图、拆墙图、蒸馏与重生成示意为本站绘制。许可区表述依据许可证协议原文(Applicable Territory 条款)。H3 自家价格(2K $0.13/秒、768p $0.08/秒、再生成 $0.05/秒、Context-IR 按 token)取自官方按量付费价目(platform.minimax.io,2026-08-03);Kling / Seedance 对比价来自第三方整理(GlobalGPT / AtlasCloud,2026-08)。效果定性均为厂商自评,技术报告与第三方评测尚未发布。