工具教程 · 小互解读

Magnific 发布 38 页全新图像视频提示词手册:针对当下前沿模型 传统提示方式已经失效

提示词原文、禁用词表、镜头规矩都能直接抄;但模型排名出自 Magnific 自家团队,没给测试方法。
一分钟速览
  • 大多数人写提示词还在堆「8K、超清、大师杰作」这类词。Magnific 出了本 38 页免费手册,说这套对当下这批模型已经失效,还会主动把图往一眼假的方向拽。
  • 手册最核心的一句:一眼假是模型的默认答案。你没填的每一个空,框在哪、抓哪个瞬间、什么光,模型都会拿它最平均的那个答案填上。
  • 两块可以直接抄进任何提示词的文字:一行「电影感」和一块「皮肤真实感」;外加七个禁用词,ultra sharp、hyper detailed、8K clarity 这些是在召唤 AI 味。
  • 图里要出的字必须打引号原样写进去,还要像给设计师派活一样交代版面,模型是「摆」字不是「打」字。
  • 最反直觉的一招:最强的视频编辑不在视频模型里。把片子第一帧抠出来当图改,再还回去当首帧、原片当运动参考,同一个镜头同一个运镜,只有你指定的那处变了。
  • 视频引擎有八条硬规矩:出画即消失、跨镜头最多跟三个角色、绕着镜子拍别对着镜子拍。手册说听着像迷信,但每一条都是某次渲染撞破之后才写下来的。
立场提示:这本手册是 Magnific 自家团队写的,里面的模型清单等于它平台上能用的那几个,Midjourney、Imagen、Runway、Veo 都不在表内,末页是「预约演示」。全篇反复出现「在我们的测试中」,但从头到尾没给样本量、评判方法和谁来评,所以「哪个模型最强」这一层要当经验听,不能当实测看。方法本身(怎么描述场景、怎么去掉 AI 味、怎么接镜头)跟用什么平台无关,那部分是干货。
背景

这本手册讲什么:图像、视频、影视级运镜三块

Magnific 放出了一本 38 页的免费提示手册《The Prompting Handbook》。这份手册不只覆盖图像生成,还完整补上了 AI 视频生成与影视级的导演运镜控制。它的核心理念是:AI 已经全面进入推理(Reasoning)与导演对话的时代,抛弃过去那些无用的关键词,用明确的专业视觉语言去指挥 AI。

这句话落到实处是这样:以前那套「8K、超清、大师杰作、极致细节」不但不再管用,还会主动把图往一眼假的方向拽;取而代之的做法是用大白话描述一个完整的场景,像导演给摄制组下指令、像甲方给设计师派活那样,把主体、动作、光、构图、风格一件件交代清楚。模型现在读的是句子,你交代得越具体,留给它自己发挥的空档就越少。

Magnific 原本是 Javi López 和 Emilio Nicolás 两个西班牙人在 2023 年底做的一个 AI 图片放大工具,没融过资、没投过广告,上线五个月冲到 72.5 万注册用户,2024 年 5 月被图库公司 Freepik 收购。2026 年 4 月 28 日,Freepik 索性把整个公司改名叫 Magnific。它自己不训模型,把各家模型接进来让用户按活挑,所以手册里的模型清单就是它站内能用的那几个。写手册的是内部一个 40 多人的团队 Magnific Studios,日常拿这批模型给片方和时尚品牌做真活。

这 38 页里装了什么

01图像3–18 页
  • 七个图像模型各擅长什么,怎么按活派单
  • 一条提示词该交代的六件事
  • 让图里的字不出错的写法
  • 用一句话改图,不用抠图不用重摇
  • 让同一个角色在几十张图里长得一样
  • 一份测过的看图词表,外加怎么杀掉 AI 味
02视频19–28 页
  • omni 架构:一次生成,画面和声音一起出来
  • 四个视频模型怎么分工
  • 视频提示词的八段结构
  • 首帧尾帧和参考图分别管什么
  • 把第一帧抠出来改的编辑流水线
  • 一张静态图变成整个场景的机位覆盖
03导演镜头29–37 页
  • 多镜头怎么接:五种镜头接缝
  • 八条引擎硬规矩,每条都是渲染撞破换来的
  • 十二种运镜怎么写进提示词
  • 对白、口型,和按拍子编排时间
  • 给角色拍一条试镜带锁住表演
  • 附录:一张能钉在墙上的速查表

看完你能拿走什么

五样东西

两块能粘进任何提示词的文字,一行「电影感」和一块「皮肤真实感」,加上七个绝对别写的禁用词和一组常驻负面词。

一张按活派单的模型对照表,七个图像模型加四个视频模型,不用再拿一个模型打天下。

两个写法模板,图像六段、视频八段,照着填就不会漏。

一条改视频的流水线,把片子第一帧抠出来当图改再还回去,同一个镜头只变你指定的那处。

八条引擎规矩,出画即消失、最多跟三个角色、别对着镜子拍,少踩渲染崩掉的坑。

38 页里塞了二十多条真实的提示词原文,每一条都配着它生成出来的那张图,讲到失败的写法时也直接给出翻车的样子。下面按手册自己的顺序整理,英文提示词一律保留原样,那是给模型看的,翻译过去就不灵了。

选型

七个图像模型各干各的活:选错模型,词写得再好也没用

这些模型互相之间不能替换,每一个都是为不同的工作造的,选对模型和选对词一样重要,所以选型表被放在了第一章的第一页,比任何写法都靠前。

模型最擅长最高分辨率
Nano Banana ProGoogle · Gemini 3 Pro Image电影感和美学导向的活、最难啃的提示词、主视觉大图4K
Nano Banana 2Google · Gemini 3.1 Flash Image改图、产品和品牌、大批量迭代4K
Seedream 5.0字节跳动海报、包装、电商、一整批风格统一的图(最多吃 10 张参考图)4K
GPT Image 2OpenAI版面复杂的设计、信息图、要求文字准确的图4K
Recraft V4.1RecraftLogo、图标、矢量素材、成套的品牌设计系统SVG · 2K
Flux.2Black Forest Labs品牌色精确到色号、提示词写成分镜清单(最多吃 10 张参考图)2K
Krea 2Krea从风格参考图和情绪板出发做质感2K

两个 Nano Banana 怎么选

Nano Banana 2 是 2026 年 2 月的新模型,日常大部分工作交给它就行:质量接近 Pro 但快得多,出字稳,多张参考图之间的一致性最强,改图、产品、品牌这三类活的默认选择就是它。Nano Banana Pro 是 2025 年 11 月的那一代,定位成高端选项,需要精确、需要品牌级的还原、或者要打磨最难的那条提示词时才用它,跑得慢但天花板更高。

路由规则

这两个模型每张图的价格是一样的,所以按脾气派活,不按价格派活。价格相同这件事把「省钱」这个变量从决策里去掉了,剩下的只有一个问题:这张图是要快,还是要准。

另外几个的脾气也各有说法。Flux.2 是为「控制」造的:一次能接十张参考图,能对上指定的十六进制色号,能跟着结构化的分镜清单走,适合那种从头锁到尾的品牌和产品流水线;但给它一条模糊的提示词,它会还你一张精致但平庸的图。Krea 2 走的是另一头,它为「风格」造:从风格参考图和情绪板出发,专门避开那种默认的 AI 精修味,代价是它在理解你的意思而不是照你说的做,而且图里出字很弱。Recraft 之所以能在这张表里占一格,是因为它做排版依赖度高的海报和艺术学院水准的插画,并且是这批里唯一能导出真矢量文件的。

Recraft V4.1 的排版海报样例
Recraft V4.1 的专长展示:分层的展示字体、训练过的品牌风格、以及唯一一条通向真矢量的路。图片来自手册第 11 页。
结构

一条图像提示词该交代的六件事:主体、动作、场景、光、构图、风格

现在的图像模型读的是句子不再是关键词堆。你描述一个连贯的场景,它跟着建。像 Nano Banana Pro 和 2、GPT Image 2、Seedream 这几个会推理的模型,遇到一条内容繁多的提示词会先分段读一遍再渲染,所以一个场景里有很多主体、很多细节时它们也扛得住。

结构是六段。下面这张图把一条真实的香水广告提示词拆开,看每一段管的是画面里的哪一部分:

1 2 3 4 5 6 主体 动作 场景 构图 风格
1主体a matte-black cologne bottle
2动作a single droplet hits the slate in a crown splash
3场景on wet slate, charcoal background
4hard raking light from the right, deep shadows
5构图right third of frame, tight macro framing
6风格photorealistic

六段拼起来就是完整的提示词,跑出来是下面这张图。瓶子落在画面右侧、水花在它旁边溅成一个小王冠、硬侧光扫过湿石板,画面里的每一样东西,提示词都事先点过名,没有一处是模型自己发挥的:

哑光黑香水瓶与水花王冠的产品图
Nano Banana 2 出图。客户要的是「货架上有能量」而不是摆拍,所以整条提示词只交代了三件事:瞬间、光、框。图片来自手册第 6 页。

同一套结构换个方向写,就是另一种活。左边这条把提示词当成一份版面简报:文案写什么、每个元素放哪儿、哪里留空;右边这条走电影感,靠的是几个「看起来像什么」的词。

MORNINGS, UPGRADED 竖版社交广告
版面 · GPT Image 2。标题「MORNINGS, UPGRADED」用厚重的墨黑无衬线占满上半张、分两行;副标题在左下;不锈钢保温杯在右下角带柔和阴影;一条钴蓝细线是全图唯一的点缀。手册第 6 页。
红大衣女子雨夜过马路的电影感画面
电影感 · Nano Banana 2。红大衣的女人在黄昏的湿路面上快步穿过斑马线,人带着运动模糊,身后一辆巴士拉出光轨,钠灯和橱窗光。人在左三分之一。手册第 8 页。
电影感那条提示词
35mm film still: a woman in a red coat dashes across a rain-wet crossing at dusk, mid-stride with motion blur, a bus streaking past behind, sodium streetlight and shop-window glow, muted Kodak palette, natural grain, subject on the left third, full frame edge to edge, no letterboxing, no black bars.
真正把这张图撑起来的是「muted Kodak palette」(褪色的柯达调)和「natural grain」(天然颗粒)这两个描述外观的词。后面会讲到,前面那个「35mm」几乎不起作用。
四条通则

写场景,不写标签。把主体、它在做什么、在哪儿、什么光、怎么框、什么风格说清楚就够了,「8K」「大师杰作」这类提气词全部跳过。

图里要出的字打引号。把要出现的词原样打进引号里,再说清位置(「标题顶部居中」)。产品包装上的文案同理,一字不差地重复一遍,否则模型会自己编一套。

试的时候便宜,交的时候锋利。在 1K 分辨率下反复探,选中的那张再拉到 2K 到 4K 重跑。

真产品是最难的考题。材质、纹理、标签上的字体都得在渲染里活下来。图这边 Nano Banana 2 扛得最好,视频这边是 Seedance 2.5,交付前一定要放大标签看一眼。

机制

AI 味是模型的默认答案:你没填的空,模型拿最平均的答案填上

这一节是全本手册的地基。它先给了一个观察:不管哪个模型,你放着不管,它都往同一个默认答案上跑,主体摆在正中央盯着镜头、姿势摆好、光打得平、整张画面都清楚,再加一层加工过的油光。

这东西现在有个专门的词,叫 slop,直译是泔水,指的就是那种一眼看出是 AI 生成的图。人半秒钟就能认出来,认出来之后的第一反应是:这个品牌不上心。手册对它的态度是四个字,永远别交。