工具教程 · 小互解读

MiniMax H3 官方使用手册:一个三段公式,把提示词从描述画面改成给素材派活

环绕运镜别写「环绕运镜」,要写 truck left + pan right;不想要背景音乐,得在末尾写「非叙事性音乐:N/A」。都是官方自己踩出来的规矩。
一分钟速览
  • MiniMax 给 H3 出了本使用手册,核心是一个三段公式:参考素材说明 + 核心创意 + 画面过程说明。
  • 最有用的是那些具体到反直觉的规矩,想要环绕运镜,别写「环绕运镜」,要写 truck left + pan right
  • 手册最后一节的标题叫「撰写提示词的最佳方式」,内容是:别自己写了。
本文材料来自 MiniMax 官方发布的 H3 使用手册(标注持续更新中,本站拿到的是 8 月 7 日版本),提示词与规则均为官方口径。文中定价说法来自 MiniMax 7 月 31 日的发布博文,手册本身未写价格。
开篇

这份手册值钱在一个三段公式

MiniMax 给 7 月底发布的视频模型 H3 出了一份使用手册,把「提示词到底该怎么写」拆成了一个公式、三个要素和六条踩坑,还附了几十个案例,每个案例都是原始提示词、输入的参考图、生成出来的成片三件套摆在一起。它不讲产品有多强,通篇给的是能直接抄走的写法。

市面上讲 AI 视频提示词的文章,大多停在「要写清主体、场景、动作」这种正确的废话上。这份手册给的是官方自己踩出来的具体规矩:想要环绕运镜,别写「环绕运镜」四个字;不想要背景音乐,得在提示词末尾写一句固定格式的话。这类东西自己试一个月也未必摸得出来。

整份手册的骨架就是这一条公式:

参考素材说明 每个素材干什么用 + 核心创意 一句话锁住全片 + 画面过程说明 每一秒发生什么 三段,一段都不能少
官方给的提示词总公式。后面三节各拆一段
原文照抄 · 总公式
完整提示词 = 参考素材说明 + 核心创意 + 画面过程说明
前提

但先得知道 H3 能吃什么、吐什么

动手写之前有个前提:模型的能力边界直接决定提示词该怎么写。比如提示词上限 7000 字符这一条,就解释了为什么官方给的范例动辄上千字,它是真的鼓励你把话说满。

项目H3 的规格
输出时长4-15 秒
输出帧率24 FPS
输出声音所有结果全部带声音输出,原生双声道
输出宽高比首/尾帧模式下,遵循用户输入图片的原始长宽比
文生视频模式下,遵循用户指定 21:9、16:9、4:3、1:1、3:4、9:16 范围内的长宽比
全能参考模式下,遵循用户指定上述范围内的长宽比,或选自动模式由 H3 自行判断
分辨率768p 模式(已开放):输出宽高比在 16:9~9:16 之间时,输出短边 768 像素;否则总面积约 1M 像素,例如 21:9 时为 1536×672。768p 的结果可以升级到 1440p
1440p 模式(官方推荐 👍):宽高比在 16:9~9:16 之间时输出短边 1440 像素;否则总面积约 3.7M 像素,例如 21:9 时为 2976×1248
首/尾帧入口图片 0、1、2 张;宽高范围 [256, 5760];宽高比 5:2~2:5 范围内
无图片输入时为文生视频模式
全能参考入口图片 ≤ 9 张,宽高范围 [256, 5760]
视频 ≤ 3 段,单段时长 [2, 15] 秒,总时长 ≤ 15 秒,宽高范围 [256, 5760],宽高比 5:2~2:5
音频 ≤ 3 段,且必须配图片或视频输入,不能单独输入,单段 [2, 15] 秒,总时长 ≤ 15 秒
混合输入的总上限是 12 个文件;无任何输入时为文生视频模式
输入格式视频:H.264/AVC、H.265/HEVC;视频内音频:AAC、MP3
图片:JPG、JPEG、PNG、WEBP、HEIC、HEIF
音频:WAV、MP3
传入大小视频单个 50MB;图片单个 30MB;音频单个 15MB(总和不限,限制都在单个素材上);API 请求体 64MB(推荐用 url 传入素材)
提示词上限不超过 7000 字符
语言支持支持多语言提示词输入与输出
文本转语音(TTS)精准覆盖 11 种语言,包括中文、英语、日语、韩语、法语、德语、西班牙语等
更多语言可衍生探索,如阿拉伯语、泰语、印尼语、印地语等 40 多种语言
适合海外品牌传播、多语种广告、跨语言短片和本地化产品介绍等场景

输入这边分两个入口,能力差得很远,选错入口,提示词写得再好也没用:

首 / 尾帧入口 图片 0-2 张 传 0 张 = 纯文生视频 传 2 张 = 首帧 + 尾帧 不能传视频,不能传音频 全能参考入口 图片 ≤ 9 张 视频 ≤ 3 段 音频 ≤ 3 段 单段 2-15 秒 总时长 ≤ 15 秒 不能单独传 混合输入总共不超过 12 个文件
两个入口的容量对照。音频那条最容易踩:它必须配着图片或视频一起传,不能单独上阵。本站据手册参数表绘制

手册给 H3 划的三大能力

知道模型能干哪几类活,写提示词时才知道该往哪个方向使劲。手册开头给了个官方分类,原话如下:

三大能力官方阐释
原生多模态
理解与生成
支持文字、图片、音频、视频等多种输入,理解不同素材中的人物、动作、声音、情绪、镜头、风格与表达意图,并将多种参考信息自然融合,完成从素材理解到完整视听内容生成的一体化创作。
多模态精准
编辑与控制
支持对人物、物体、场景、声音与节奏进行多维度编辑,并具备精细化指令遵循能力。创作者可以在已有内容基础上持续修改和迭代,更准确地落实对画面、声音与内容细节的调整需求。
商用级多场景
内容生成
面向影视、广告、品牌、电商与游戏等真实商业内容场景。它兼顾文字字幕、品牌信息、创意特效、产品展示、UI/UX 动态演示、游戏视觉及风格化表达,帮助创作者和内容团队更快完成创意验证、视觉提案与内容制作。

前两项各自还拆了四条细分能力,后面的案例就是按这些条目组织的:

原生多模态理解与生成全能精准编辑与修改
多素材联合参考
文字、图片、音频与视频自由组合,共同参与内容生成
角色与物体编辑
替换、删除或增加人物与物体,灵活调整画面主体
角色、动作与镜头参考
参考主角形象、人物动作、镜头运动与画面构图
场景与视觉效果编辑
替换背景、调整光影氛围,并增加或修改视觉特效
音色迁移与克隆
参考音频音色,丝滑更新角色声音
声音、台词与音色修改
替换台词、迁移音色、调整人声及相关声音内容
氛围与剪辑理解
参考原视频的视觉风格、叙事节奏、声音氛围与整体剪辑感
高精度指令控制
准确执行局部修改与细化要求,同时保持未编辑内容相对稳定
公式第一段

第一段:先给每个素材派活

这是全篇最需要转过弯来的一处。过去写视频提示词,第一件事是描述画面;现在第一件事变成了逐个交代你上传的每个素材是干什么用的

两件事:写清编号(按你上传的顺序,@图片1@音频2@视频3),写清用途。

@图片1 @视频1 @音频1 人物参考 锁住这张脸 动作参考 照这个动作演 音色参考 用这个人的嗓子
同一句提示词里,三个素材各领一份差事。本站示意图

官方把「用途」列成了一张词表,一共 13 个标签。这张表本身就可以照抄,写第一段时对着挑就行:

人物参考 锁定脸/形象 物体参考 锁定物体 场景参考 锁定场景 关键帧 首帧尾帧要明说 音色参考 锁定音色 故事版 按分镜生成 风格参考 照这个风格来 构图参考 照这个构图排 音频复用 声音直接拿来用 音频部分复用 只用某段某轨 动作参考 锁定动作 运镜参考 锁定镜头运动 视频编辑 对视频增删改
原文照抄 · 第一段范例
@图片1 提供了xx角色的形象(如果有多个角色,需要能指代清楚),@视频2提供了动作参考。

还有两条补充规则很实在。素材里有特别想保住的特征,明确写出来,一致性会更好。做音频复刻时,如果对白或歌词内容必须保住,官方强烈建议把歌词原文一起补上,比如「@音频1 作为目标视频的音频复刻素材,具体歌词是:'ABCDEFGHIJKLMN'」。

「音色参考」这个标签实际长什么样,看一眼就懂:给一段音频当音色参考,再给一句要说的台词,人物就用那个嗓子把话说出来。

音色克隆案例。提示词只有一句:「角色说话:Follow the wind, live free. Leave worries behind, enjoy the moment,音色参考音频1」。来源:MiniMax 官方手册

词表最后那个「视频编辑」标签,管的是改片子。最简单的一条提示词就是一句大白话,「把视频中的猫换成狗」:

提示词全文:「把视频中的猫换成狗」。来源:MiniMax 官方手册

没传素材的时候,这一整段跳过。

公式第二段

第二段:一句话锁住全片

素材派完活,接着定这条片子是什么。核心创意要用一句话锁住全片,官方要求它必须包含四样东西:主体(谁/什么)、地点(在哪)、事件(在做什么)、题材风格(写实/动画/电影感/广告片……),另外可以补一个特殊运镜(航拍/一镜到底/慢动作)。

原文照抄 · 第二段范例
一位穿汉服的年轻女子(@图片1)在樱花纷飞的庭院里舞剑,古典国风,电影质感,一镜到底。
主体是穿汉服的女子(并且用 @图片1 锁住了脸),地点是樱花庭院,事件是舞剑,风格是古典国风加电影质感,最后补了个运镜要求。四样齐了。

这一段里藏着两条外面很少讲的硬规矩。

规矩一

H3 默认会切镜。你不说「一镜到底」,它就会自己切。想要一镜到底,得明说。

规矩二

想要环绕运镜,别直接写「环绕运镜」。官方建议写成 truck left + pan right,或者反方向的 truck right + pan left

官方还把「题材风格」和「切镜风格」各列了几个具体选项,写的时候直接挑:

原文照抄 · 风格与切镜的可选项
题材/风格:写实 / 动画 / 电影感 / 广告片 / 纪录片……
特殊风格列举:赛博朋克 / 霓虹灯美学 / 涂鸦风 等

特殊运镜:航拍 / 一镜到底 / 慢动作……
  · 默认会切镜
  · 运镜风格:写清即可;注意环绕运镜,建议用 truck left + pan right
    或者 truck right + pan left,而非直接说环绕运镜
  · 切镜风格:
    · 普通切镜(cut)
    · 叠化切镜(fade)
    · 随着节奏卡点切镜
    · 快切

如果任何元素有直接和引用素材的关联,都欢迎用 @图片1 / @音频1 / @视频1 等方式强调。
truck 和 pan 是什么

truck 是整台摄影机横着平移,pan 是机器不动、只把镜头左右转。你端着手机绕一个人转圈的时候,脚在横着走(truck),手腕同时跟着转好让人一直待在画面中间(pan),两个动作叠在一起,看上去就是「环绕」。所以官方让你把这个结果拆成两个具体动作来写,模型反而更懂。

还有一条跟文字有关:你想让视频里出现具体的文字、Logo、标题、按钮文案,必须把原文一字不差写出来。比如「手机屏幕上显示标题:'AI Video Creation',按钮文字为:'Start Now'」。手册里那些满屏文字动效的案例,提示词里都老老实实把每个字写死了:

MG 动画案例。提示词里明确规定了要出现的品牌名、Slogan,以及「除以上两组文字外,画面中不得出现任何其他可读文字」。来源:MiniMax 官方手册
公式第三段

第三段:按时间轴写想要和不想要

定完全片调性,所以最后才写每一秒发生什么。这一段按时间轴分块,以「切镜」为时间戳,每一块要写六项。

0-3 秒 3-8 秒 8-12 秒 …每次切镜一块 每一块里要写这六项: 景别 内容 运镜 动作 台词 音效 写完「想要」,还要单独写一段「不想要」,最典型的是关掉背景音乐
画面过程说明的写法。本站据手册整理绘制
原文照抄 · 第三段范例
0-3 秒:全景,女子(@图片1)从画面左侧缓步走入樱花庭院(@图片2),背景虚化,没有对白,只有脚步声。
3-8 秒:切镜到女子(@图片1)的中景,她拔出长剑(@图片3),缓缓起势,樱花瓣从树上飘落。镜头推进。
8-12 秒:切镜到特写,剑光一闪,慢动作,樱花被剑气激得四散。
非叙事性音乐:N/A

最后那行就是「不想要」的写法。想让视频里没有背景音乐,光说「不要 BGM」不管用,得写这句:

原文照抄 · 关掉背景音乐
非叙事性音乐:N/A

或者用英文格式:
"non_diegetic_music": N/A
「非叙事性音乐」(non-diegetic music)是什么

指画面里的人听不见、只有观众听得见的那层音乐,也就是通常说的背景配乐。恐怖片里那段让你手心冒汗的弦乐,戏里的主角是听不见的,它就是非叙事性音乐。跟它相对的是画面里真实存在的声源,比如角色自己打开的收音机。想让 H3 别加那层配乐,就得点它的名字。

另外两条:尽量少写比喻句,多写看得见的画面,H3 擅长的是明确的画面指令,抽象比喻它接不住;有台词就必须写出具体内容,不能只写「她说了句狠话」。

这一段写到极致是什么样?手册里有条提示词一口气要求改四处东西,每一处都写得死死的:

提示词要求:开头的易拉罐饮料替换为可口可乐;背景中发光的「全家」便利店招牌改成「互惠」;结尾塑料袋里的零食全部换成可乐易拉罐;最后人物台词从「买了一些小零食」改成「买了一堆可乐」。来源:MiniMax 官方手册
分镜

台词跟镜头对不齐,口型就崩

但写分镜还有个官方特意强调的坑。手册在这条后面专门加了句「这个得强调下,很多口型问题会来自于这个」,

核心

台词的长短,必须和每个镜头的长短对得上。别在一个 3 秒的镜头里塞一大段话,官方原话是「会非常影响效果」。

❌ 3 秒的镜头,塞一整段话 Shot 1 · 3 秒 台词长度远远超出这个镜头能装下的量 → 口型对不上 ✓ 台词拆开,每段对上一个镜头 Shot 1 · 3 秒 Shot 2 · 5 秒 Shot 3 · 3 秒 台词长度 = 镜头长度
本站示意图

相关的还有三条:

跨镜头的台词,要写明它跨了哪些镜头。H3 能响应 J-cut 和 L-cut,但你得说清楚。

J-cut / L-cut 是什么

声音和画面故意不在同一时刻切换:一句话还没说完就切到下一个画面,或者下一个场景的声音先响起来、画面才跟上。像看剧时还没看到人,先听见他在门外喊你,声音先到,画面后到。

说话的人是谁、在不在画面里,要交代清楚。手册给了个复杂例子:

原文照抄 · 跨镜头台词怎么写
一个画外音响起说:Wake up Wake up。之后切镜到一个中年妇女的近景,她是画外音的主人,她继续说道:It's time to go to school!

切镜的时候写清切到什么景别、主体是前面哪个角色,跨镜头的一致性会保持得更好。

变体

三种模式,提示词写法不一样

那么同样一套公式,喂法不同写法也不同。手册把它分成三种模式:

模式写法要点
多模态参考
图+视频+音频一起传
每个素材都要写清它的角色:@图片1 锁脸、@视频1 锁动作、@音频1 定情绪
图生视频只传 1 张图,要说清它是首帧还是尾帧传首+尾帧两张图时,H3 不会自动加切镜,只补两帧之间的动作、光影和声音
纯文字生成描述要更具体(主体外观、场景细节、动作都得写清),多用「大全景交代空间 + 中景承载动作 + 特写强调细节」的分层写法

中间那条容易踩:很多人传首尾帧是想让 H3 在两张图之间「演一段」,结果发现它老老实实只补了中间的动作,没有任何镜头切换。这是设计如此,不是失败。

错题本

官方自己列了六个最常踩的坑

写法讲完了,接着看官方替你总结的错题本。这张表可以直接贴在手边:

你的写法怎么改
只写一段话没分段按三段公式拆开写
素材上传了但没说用途补一句「@图片1 是 XX 参考」
想用音乐但说「不要 BGM」这两个矛盾,要么删一个,要么分场景写
想一镜到底但写了很多分镜全文保持一段情节描述,删掉【镜头 N】结构
想要主角脸一致但没传图一定要上传人物参考图,并标注「人物参考」
提示词太短,又没传素材至少写出主体外观 + 场景细节 + 动作 + 风格
范文

两条上千字的成品,可以直接抄

但光有规则还不够,官方在手册末尾给了两份写满的范文,都是上千字的完整提示词,结构严格按三段式排。

第一条:大字幕 MV

trap 音乐录像带风格。这条最值得学的是它有一整段「律动规则」,把音乐节拍和画面动作绑死

原文照抄 · 律动规则
hi-hat roll → 快速微震、跳帧、文字细碎重组
snare → 文字猛然放大、画面硬切、人物肩膀下压
808 bass hit → 低频压屏、画面短暂变形、文字纵向拉伸或横向压缩
vocal 关键词 → 嘴型同步、下颌动作、头部点拍、手势推进
它没有笼统写「跟着节奏卡点」,而是把每一种鼓点分别对应到画面上的一个具体动作。