Magnific 发布 38 页全新图像视频提示词手册:针对当下前沿模型 传统提示方式已经失效
- 大多数人写提示词还在堆「8K、超清、大师杰作」这类词。Magnific 出了本 38 页免费手册,说这套对当下这批模型已经失效,还会主动把图往一眼假的方向拽。
- 手册最核心的一句:一眼假是模型的默认答案。你没填的每一个空,框在哪、抓哪个瞬间、什么光,模型都会拿它最平均的那个答案填上。
- 两块可以直接抄进任何提示词的文字:一行「电影感」和一块「皮肤真实感」;外加七个禁用词,ultra sharp、hyper detailed、8K clarity 这些是在召唤 AI 味。
- 图里要出的字必须打引号原样写进去,还要像给设计师派活一样交代版面,模型是「摆」字不是「打」字。
- 最反直觉的一招:最强的视频编辑不在视频模型里。把片子第一帧抠出来当图改,再还回去当首帧、原片当运动参考,同一个镜头同一个运镜,只有你指定的那处变了。
- 视频引擎有八条硬规矩:出画即消失、跨镜头最多跟三个角色、绕着镜子拍别对着镜子拍。手册说听着像迷信,但每一条都是某次渲染撞破之后才写下来的。
这本手册讲什么:图像、视频、影视级运镜三块
Magnific 放出了一本 38 页的免费提示手册《The Prompting Handbook》。这份手册不只覆盖图像生成,还完整补上了 AI 视频生成与影视级的导演运镜控制。它的核心理念是:AI 已经全面进入推理(Reasoning)与导演对话的时代,抛弃过去那些无用的关键词,用明确的专业视觉语言去指挥 AI。
这句话落到实处是这样:以前那套「8K、超清、大师杰作、极致细节」不但不再管用,还会主动把图往一眼假的方向拽;取而代之的做法是用大白话描述一个完整的场景,像导演给摄制组下指令、像甲方给设计师派活那样,把主体、动作、光、构图、风格一件件交代清楚。模型现在读的是句子,你交代得越具体,留给它自己发挥的空档就越少。
Magnific 原本是 Javi López 和 Emilio Nicolás 两个西班牙人在 2023 年底做的一个 AI 图片放大工具,没融过资、没投过广告,上线五个月冲到 72.5 万注册用户,2024 年 5 月被图库公司 Freepik 收购。2026 年 4 月 28 日,Freepik 索性把整个公司改名叫 Magnific。它自己不训模型,把各家模型接进来让用户按活挑,所以手册里的模型清单就是它站内能用的那几个。写手册的是内部一个 40 多人的团队 Magnific Studios,日常拿这批模型给片方和时尚品牌做真活。
这 38 页里装了什么
- 七个图像模型各擅长什么,怎么按活派单
- 一条提示词该交代的六件事
- 让图里的字不出错的写法
- 用一句话改图,不用抠图不用重摇
- 让同一个角色在几十张图里长得一样
- 一份测过的看图词表,外加怎么杀掉 AI 味
- omni 架构:一次生成,画面和声音一起出来
- 四个视频模型怎么分工
- 视频提示词的八段结构
- 首帧尾帧和参考图分别管什么
- 把第一帧抠出来改的编辑流水线
- 一张静态图变成整个场景的机位覆盖
- 多镜头怎么接:五种镜头接缝
- 八条引擎硬规矩,每条都是渲染撞破换来的
- 十二种运镜怎么写进提示词
- 对白、口型,和按拍子编排时间
- 给角色拍一条试镜带锁住表演
- 附录:一张能钉在墙上的速查表
看完你能拿走什么
两块能粘进任何提示词的文字,一行「电影感」和一块「皮肤真实感」,加上七个绝对别写的禁用词和一组常驻负面词。
一张按活派单的模型对照表,七个图像模型加四个视频模型,不用再拿一个模型打天下。
两个写法模板,图像六段、视频八段,照着填就不会漏。
一条改视频的流水线,把片子第一帧抠出来当图改再还回去,同一个镜头只变你指定的那处。
八条引擎规矩,出画即消失、最多跟三个角色、别对着镜子拍,少踩渲染崩掉的坑。
38 页里塞了二十多条真实的提示词原文,每一条都配着它生成出来的那张图,讲到失败的写法时也直接给出翻车的样子。下面按手册自己的顺序整理,英文提示词一律保留原样,那是给模型看的,翻译过去就不灵了。
七个图像模型各干各的活:选错模型,词写得再好也没用
这些模型互相之间不能替换,每一个都是为不同的工作造的,选对模型和选对词一样重要,所以选型表被放在了第一章的第一页,比任何写法都靠前。
| 模型 | 最擅长 | 最高分辨率 |
|---|---|---|
| Nano Banana ProGoogle · Gemini 3 Pro Image | 电影感和美学导向的活、最难啃的提示词、主视觉大图 | 4K |
| Nano Banana 2Google · Gemini 3.1 Flash Image | 改图、产品和品牌、大批量迭代 | 4K |
| Seedream 5.0字节跳动 | 海报、包装、电商、一整批风格统一的图(最多吃 10 张参考图) | 4K |
| GPT Image 2OpenAI | 版面复杂的设计、信息图、要求文字准确的图 | 4K |
| Recraft V4.1Recraft | Logo、图标、矢量素材、成套的品牌设计系统 | SVG · 2K |
| Flux.2Black Forest Labs | 品牌色精确到色号、提示词写成分镜清单(最多吃 10 张参考图) | 2K |
| Krea 2Krea | 从风格参考图和情绪板出发做质感 | 2K |
两个 Nano Banana 怎么选
Nano Banana 2 是 2026 年 2 月的新模型,日常大部分工作交给它就行:质量接近 Pro 但快得多,出字稳,多张参考图之间的一致性最强,改图、产品、品牌这三类活的默认选择就是它。Nano Banana Pro 是 2025 年 11 月的那一代,定位成高端选项,需要精确、需要品牌级的还原、或者要打磨最难的那条提示词时才用它,跑得慢但天花板更高。
这两个模型每张图的价格是一样的,所以按脾气派活,不按价格派活。价格相同这件事把「省钱」这个变量从决策里去掉了,剩下的只有一个问题:这张图是要快,还是要准。
另外几个的脾气也各有说法。Flux.2 是为「控制」造的:一次能接十张参考图,能对上指定的十六进制色号,能跟着结构化的分镜清单走,适合那种从头锁到尾的品牌和产品流水线;但给它一条模糊的提示词,它会还你一张精致但平庸的图。Krea 2 走的是另一头,它为「风格」造:从风格参考图和情绪板出发,专门避开那种默认的 AI 精修味,代价是它在理解你的意思而不是照你说的做,而且图里出字很弱。Recraft 之所以能在这张表里占一格,是因为它做排版依赖度高的海报和艺术学院水准的插画,并且是这批里唯一能导出真矢量文件的。
一条图像提示词该交代的六件事:主体、动作、场景、光、构图、风格
现在的图像模型读的是句子不再是关键词堆。你描述一个连贯的场景,它跟着建。像 Nano Banana Pro 和 2、GPT Image 2、Seedream 这几个会推理的模型,遇到一条内容繁多的提示词会先分段读一遍再渲染,所以一个场景里有很多主体、很多细节时它们也扛得住。
结构是六段。下面这张图把一条真实的香水广告提示词拆开,看每一段管的是画面里的哪一部分:
六段拼起来就是完整的提示词,跑出来是下面这张图。瓶子落在画面右侧、水花在它旁边溅成一个小王冠、硬侧光扫过湿石板,画面里的每一样东西,提示词都事先点过名,没有一处是模型自己发挥的:
同一套结构换个方向写,就是另一种活。左边这条把提示词当成一份版面简报:文案写什么、每个元素放哪儿、哪里留空;右边这条走电影感,靠的是几个「看起来像什么」的词。
35mm film still: a woman in a red coat dashes across a rain-wet crossing at dusk, mid-stride with motion blur, a bus streaking past behind, sodium streetlight and shop-window glow, muted Kodak palette, natural grain, subject on the left third, full frame edge to edge, no letterboxing, no black bars.
写场景,不写标签。把主体、它在做什么、在哪儿、什么光、怎么框、什么风格说清楚就够了,「8K」「大师杰作」这类提气词全部跳过。
图里要出的字打引号。把要出现的词原样打进引号里,再说清位置(「标题顶部居中」)。产品包装上的文案同理,一字不差地重复一遍,否则模型会自己编一套。
试的时候便宜,交的时候锋利。在 1K 分辨率下反复探,选中的那张再拉到 2K 到 4K 重跑。
真产品是最难的考题。材质、纹理、标签上的字体都得在渲染里活下来。图这边 Nano Banana 2 扛得最好,视频这边是 Seedance 2.5,交付前一定要放大标签看一眼。
AI 味是模型的默认答案:你没填的空,模型拿最平均的答案填上
这一节是全本手册的地基。它先给了一个观察:不管哪个模型,你放着不管,它都往同一个默认答案上跑,主体摆在正中央盯着镜头、姿势摆好、光打得平、整张画面都清楚,再加一层加工过的油光。
这东西现在有个专门的词,叫 slop,直译是泔水,指的就是那种一眼看出是 AI 生成的图。人半秒钟就能认出来,认出来之后的第一反应是:这个品牌不上心。手册对它的态度是四个字,永远别交。
