字节官方 Seedance 2.5 提示词指南:从一句话公式到 30 秒长片,模板全可直接抄
50 份素材怎么派活、30 秒长片怎么分段、改片子怎么只动一处,官方把每类任务的推荐写法都写成了可复制模板。
- 字节自己下场教写 Seedance 2.5 提示词:一句话生成、素材调度、长片分段、改片延长,每类任务都有官方模板,模板连同全部示例都收在这一页里,直接抄。
- 整份指南其实在教同一件事,别让模型猜。有三个句式贯穿全篇,学会它们等于学会了一半。
- 文末还老实交代了它做不到什么:有几类内容,官方自己劝你别指望模型直出。
Seedance 2.5 是个什么模型,先垫个底
字节跳动给发布刚两天的 Seedance 2.5 出了一份官方提示词指南:从一句话生成,到 50 份参考素材怎么调度、30 秒长片怎么分段、改片子怎么只动一处,每类任务都配了能直接抄用的模板。对用即梦或 API 做视频的人,这是第一份成体系的官方写法手册,此前这些新能力只能靠社区帖子摸索。
先给没摸过这个模型的人垫个底。Seedance 2.5 是字节 Seed 团队 7 月 31 日发布的视频创作模型:单条视频从上一代的 15 秒翻倍到 30 秒直出;一次能组合的参考素材从 15 份涨到 50 份;还新增了对已有视频的编辑和延长。发布当天即梦和豆包专业版就能用。能力大了,提示词的写法也跟着变了,素材要编号派活,长片要分段描述,这正是这份指南要解决的问题。
相比 2.0,官方给出的四个主要突破:
- 单段时长上限直接拉到 30 秒,镜头表达更连贯,无需后期拼接即可呈现完整的情绪起伏与剧情推进;
- 同时具备高保真时序延长能力,可在保持人物、场景、镜头一致性的前提下,把短素材自然延展为更长成片,提升创作效率与成片品质。尤其适配广告 TVC、短剧、品牌故事片等对叙事完整度要求高的场景。
- 单次输入素材上限提升至 50 个全模态素材(图片 / 视频 / 音频自由组合),创作者可以一次性投喂完整的角色集合、场景集合、参考镜头与品牌音乐,模型综合理解后输出贴合创意意图的成片;
- 对复杂素材的稳定保持能力同步提升,专业级 3D 白模、产品包装、品牌 VI 等高复杂度资产都能被原样承接,前期投入的设计与镜头调度可直接复用。
- 新增视频局部编辑能力:在维持整体画面、镜头与节奏不变的前提下,对画面内的背景、商品、人物等局部元素进行精准修改,实现「一次创作、多版交付」;
- 生成结果由此可修改、可迭代、可交付,压缩后期返工成本。典型场景包括广告内容的本地化适配(出海广告快速更换人种 / 商品 / 文案)、电商素材的 SKU 批量复用,以及品牌内容的多渠道版本化。
- 原生支持 10 余种语言,全球创作者均可以母语描述创意意图,无需借助翻译或额外的语言转换;
- 指令理解与控制能力同步强化,对复杂镜头调度、情绪转折与多层次场景描述都能更精准遵循,服务面向全球的创作与商业化场景。
完整的发布解读、演示片和上手入口都在站内这篇:
通读整份指南会发现,所有技巧都指向同一个原则:把模型要猜的地方全部写死。三个高频句式贯穿全篇,「只采用……不采用……」「结束时画面里能看到……」「X 对应 @图片N」。下面每一节都会反复见到它们。
一条提示词六个零件,用几个拿几个
基础公式:主体 + 动作或事件是必写项,说明「谁或什么」正在「做什么」;场景环境、视觉风格、运镜切镜、声音四件可选,不需要的直接省略。动作优先概括主要过程,只为关键动作写细节,同一动作别重复描述。生成参数(时长、比例)不写进提示词,由生成页面或 API 设置。
<主体>在<场景与环境>中<主要动作或事件>。 画面呈现<视觉风格>。 镜头采用<景别、机位、运镜或切镜>。 声音包括<对白、环境声、音效或音乐>。
一名陶艺师在清晨的工作室里完成一只浅蓝色陶杯,将它从转盘上取下并放到木架中央。 窗外柔和晨光照入室内,湿润陶土呈现细腻光泽,工作台保持整洁。 镜头先以中景记录拉坯动作,再缓慢推近陶杯表面的纹理,最后切到木架正面。 保留转盘低沉转动声、陶土摩擦声和轻微室内环境声。
声音和文字有四个专用符号
提示词全程用自然语言就行。需要进一步区分音乐、音效、台词和字幕时,用这套符号:
| 内容 | 符号 | 示例 |
|---|---|---|
| 音乐 | () | (背景播放舒缓节奏的钢琴乐) |
| 音效 | <> | <远处传来钟声> |
| 台词 | {} | {你好,欢迎回来} |
| 字幕 | 【】 | 【第一章:启程】 |
要控制字幕和声音,直接写明保留什么、不要什么:
无背景音乐,只保留人物对白、环境声和动作音效。 不要字幕。 不要任何声音。
台词语言容易跑偏,写法上要加固
台词用非中文时,先在台词前写明语言:
女孩用日语轻声说:{もう大丈夫です}如果台词文本是英语、模型却说成了中文,或者需要控制地区口音,用这条加固公式:
台词语言 + 地区变体或口音 + 表达方式 + 说话人 + {台词内容}
台词语言:美式英语。女孩用自然、口语化的美式英语说:{I thought you weren't coming.}
台词语言:地道的洛杉矶美式英语。年轻男子用自然的洛杉矶口语说:{No way, you actually made it.}素材能塞 50 份,但稳定区比上限小得多
一次最多组合 50 份参考素材。四类素材各有输入范围,官方同时给了一组小得多的「推荐范围」,上限是能力边界,推荐范围才是稳定区,素材越多稳定性越容易下降:
| 素材类型 | 输入范围 | 推荐范围(稳定区) |
|---|---|---|
| 图片 | 最多 30 张,单张不超过 4K | 主体图片以 1 至 8 个主体为宜 |
| 视频 | 最多 10 段,总时长不超过 30 秒 | 1 至 5 个主体,单段 5 至 10 秒 |
| 音频 | 最多 10 段,总时长不超过 30 秒 | 只留与任务直接相关的台词、音色、环境声或音乐 |
| 视频编辑 | 视频与参考图共同完成编辑 | 原视频 20 秒以内,参考图 1 至 5 张 |
超过推荐范围仍可尝试:主体图可以扩到 9 至 12 个主体,主体音视频扩到 6 至 10 个主体,编辑参考图扩到 6 至 8 张。另一个提高稳定性的细节:同一主体需要多视角时,一张图放一个视角,比把几个视角拼成一张拼贴图更稳。声明写法是这样:
@图片1定义同一盏折叠台灯的正面外观。 @图片2定义同一盏折叠台灯的左侧结构。 @图片3定义同一盏折叠台灯的右侧结构。 @图片4定义同一盏折叠台灯的背面结构。 四张图片共同定义同一盏折叠台灯,成片中始终只有一盏折叠台灯。
每份素材写清:用什么,不用什么
传完素材,要逐份声明它提供什么。三条铁律:映射关系必须写进提示词正文;别只靠图片里贴的文字标签;别让模型自己猜哪份素材对应哪个人物、道具或场景。「不采用」倒不必每份都写,只在素材里的人物、背景或构图容易被误带进成片时才写。
@图片1用于<主体>的<外貌、服装、结构或材质>。 @视频1用于<动作、运镜或节奏>。 @音频1用于<角色或声音类型>的<音色、台词、环境声或音乐>。 <主体>在<场景>中完成<主要动作或事件>。 画面呈现<视觉风格>,镜头采用<镜头表达>。
看官方示例(陶艺师素材版)
@图片1用于<陶艺师>的五官、发型和深绿色围裙,不采用图片背景。 @图片2用于<陶艺工作室>的木质工作台、窗户位置和晨间光线,不采用图中人物。 @视频1用于双手拉坯、托起陶杯和放置陶杯的动作节奏,不采用视频中的人物身份、服装和场景。 <陶艺师>在清晨的<陶艺工作室>完成一只浅蓝色陶杯,将它从转盘上取下并放到木架中央。 镜头先以中景记录拉坯动作,再缓慢推近陶杯表面的纹理;保留转盘转动声、陶土摩擦声和室内环境声。
还有一条:参考视频已经把动作、运镜和顺序都定准时,只需说明继承哪些内容,别逐个动作复述,重复描述反而可能跟素材本身打架。
几十份素材怎么组织:分场景派活
素材一多,提示词的重点就变成写清人物、道具、场景、动作和声音之间的对应关系,把全部素材塞进同一句话没有用。官方给了一套五步组织法,最终目标是让模型在每个场景里挑对素材,全员同框从来就不是目标:
第一步,给每个人物、商品、道具单独命名并绑定素材:
<人物A>对应@图片1,只采用外貌、发型和服装。 <人物B>对应@图片2,只采用外貌、发型和服装。 <道具A>对应@图片3,只采用结构、材质和颜色。 <场景A>参考@图片4,只采用空间布局、建筑和光线,不采用图中人物。
第二步,素材多了按类型整理,人物、道具、场景、动作声音各归各组:
【人物】 <修复师>对应@图片1,只采用外貌、发型和服装。 <记录员>对应@图片2,只采用外貌、发型和服装。 <布展员>对应@图片3,只采用外貌、发型和服装。 <讲解员>对应@图片4,只采用外貌、发型和服装。 四人的外貌、服装、动作、站位和台词不互相交换。 【道具】 <样本盒>对应@图片5,只属于<修复师>。 <记录板>对应@图片6,只属于<记录员>。 【场景】 <修复室>参考@图片7,只采用空间、材质和光线。 <展厅>参考@图片8,只采用空间、材质和光线。 【动作与声音】 @视频1用于<修复师>打开样本盒的动作,不采用视频中的人物和场景。 @音频1用于<讲解员>的音色和指定台词。
第三步,同一人物要跨场景用多份素材时,给他建一份集中档案:
