产品发布 · 小互解读

字节跳动发布 Seedance 2.5:单次 30 秒直出,一条指令能同时指挥 50 个参考素材

即梦与豆包专业版当天上线,火山方舟 API 还没上,价格也没公布。

一分钟速览
  • 以前一条只有 15 秒,够拍一个镜头;想拍一场戏,得自己拆开抽、再拼。现在一条 30 秒能装完一场戏。
  • 一次能喂进去的参考素材从 15 个涨到 50 个,一条音乐会演示里,18 张图各自被派了活。
  • 你要写的东西也跟着变了:现在的指令按秒分段,还要给每份素材编号。
⚑ 这篇的材料来自字节跳动 Seed 团队自己的发布博客、Seedance 2.5 项目主页,以及官方账号当天发的两条推文。演示视频全部是挑出来的成品。豆包专业版的套餐门槛来自 PChome 的报道;即梦与 Dreamina 的「超长视频模式」和 1 秒时间戳精度是平台自己的说法,与模型博客有出入,文中都标了出处。
开场

时长翻一倍、参考素材涨到三倍多,改片子能定位到第几秒

字节跳动 Seed 团队 7 月 31 日发布了新一代视频创作模型 Seedance 2.5。对做视频的人来说,这次变的不只是画质:一条视频能装下一整场戏,一次能同时指挥几十份参考素材,改片子的时候还能定位到第几秒。

开场先甩了一部 4 分 22 秒的短片,全片由 Seedance 2.5 独立生成,没有实拍素材。同一条片子也是官方账号 ByteDance Seed(@ByteDanceSeed_) 当天那条推文的内容。这里先留个疑问:4 分 22 秒远超单次生成的 30 秒,它是怎么接起来的,发布页没有交代。

4 分 22 秒创意短片,全片由 Seedance 2.5 生成,画面与声音一起出。来源:Seedance 2.5 发布博客。

上一代 Seedance 2.0 发布于 2026 年 2 月 12 日,隔了五个多月。底层没换架构,还是同一套多模态音视频联合生成,文字、图片、音频、视频四种输入一起吃。往前推的是三件事:一条能讲多长、一次能参考多少、改片子能改到多细。第三件要说清楚,上一代就能挑出片段、角色、动作或剧情来改,这一代新增的是按时间戳定位,以及绿幕、视角与运镜、参考这几类编辑的增强。

单次生成时长 15 秒 · Seedance 2.0 30 秒 · Seedance 2.5 单次参考素材上限 15 个 9 图 + 3 视频 + 3 音频 50 个 30 图 + 10 视频 + 10 音频 改片子能改到多细(这一行不是数量对比,两根条等长) 2.0:挑片段 / 角色 / 动作 / 剧情改 2.5:再加按时间戳定位 绿幕 / 视角运镜 / 参考编辑同步增强
Seedance 2.0(2026-02-12)到 2.5(2026-07-31)的三项变化,数字取自两代的发布博客。前两行按各自数值等比,行与行之间不可横向比较;第三行是能力描述,两根条等长。
30 秒
单次生成上限(上一代 15 秒)
50 个
单次参考素材上限(上一代 15 个)
4:22
开场短片全长(接法未公布)
叙事

这 30 秒里能跑完一场戏:铺垫、推进、转折、收尾

时长翻倍这件事,听起来只是把 15 秒改成 30 秒。真正被强调的是这 30 秒装的东西不一样了,它要在一条镜头里组织好几个有前后关系的画面,把一个故事从铺垫、推进、转折走到收尾,而不是把同一个画面拖长一倍。

演示是一段女歌手登台。镜头从红色厚幕布的缝隙里推进去,进到暖色的后台化妆间,她背对镜头整理耳机,工作人员提醒她准备上场;她回头看向镜头,开口唱起 City Pop;镜头后退跟着她穿过幕布、走进后台通道,和舞伴自然互动,有人把麦克风递过来;然后两人一起登台,镜头绕到背面,红黑两色的舞台布景、LED 屏、追着人走的聚光灯、烟雾、反光地板一层层展开;最后拉远到体育馆全景,满场观众、灯牌和荧光棒。

30 秒一镜到底:从化妆间到体育馆全景,中间不剪。这条只给了文字、没给参考素材(发布页标的 T2V,就是纯文字生成视频)。来源:Seedance 2.5 发布博客。
幕布缝里 推镜头进去 是化妆间 有人提醒她 准备上场 她回头开唱 镜头后退 跟着她穿过 后台通道 登台绕到背面 舞美一层层 展开 拉远到 体育馆全景 满场荧光棒 00:00 00:05 00:10 00:15 00:20 00:25 00:30 上一代 Seedance 2.0 的单次上限 上排五张卡按剧情先后排列,宽度不代表各占几秒
歌手那条演示的五个节拍,按剧情先后排列。发布页只给了场景顺序、没给逐秒时间点,所以卡片宽度不代表各占几秒;下方括号标的是上一代 15 秒到哪里为止。
歌手那条的完整生成指令
一镜到底手持稳定器跟拍,镜头从红色厚重幕布缝隙缓缓推进,进入暖色后台化妆间。年轻女歌手背对镜头整理耳机,工作人员提醒她准备登台。她回头看向镜头,开始唱起 City Pop。镜头后退跟拍,歌手穿过幕布进后台通道,与舞伴自然互动,一位工作人员把麦克风递给她。随后歌手与舞伴登上舞台,镜头绕至背面,红黑舞美、LED 屏、追光、烟雾与反光地板逐渐展开。镜头最终拉远至体育馆全景,呈现满场观众、灯牌、荧光棒与欢呼声,营造年轻自由的演唱会高潮氛围。
整条指令是按镜头运动一路写下来的:先说机位(一镜到底、手持稳定器跟拍),再按顺序交代每一步画面里发生什么。它已经比「一个女歌手在演唱会上唱歌」长了十几倍。

镜头绕人转一圈,人和背景不会变样

视频一长,最容易露馅的是主体自己会变:转个身脸就换了,衣服花纹对不上,背景也漂了。京剧那条演示专挑这件事演,镜头伴着主角旋身、水袖甩起完成一次环绕运镜,人和背景在整个过程里保持一致,水袖在空中划出的弧线也贴着重力走。

京剧演示:环绕运镜、水袖甩动、三个角色先后出场。这条带了参考素材(发布页标的 R2V,就是带着参考图、参考视频或参考音频生成视频),指令里点名了霸王、虞姬、武生和场景各自对应哪张图。来源:Seedance 2.5 发布博客。

专门治了一遍「油腻感」

AI 视频有一种一眼就能认出来的假:皮肤太滑像打了蜡,眼神发直,颜色饱和度过头,整个画面像抹了一层油。这次对物体材质、人物肤质与眼神、光影、画面饱和度做了一轮优化,目标是更接近实拍的质感。同一批改动还治了另一个常见毛病:生成视频时凭空多出一行字幕,或者自己冒出一段配乐。这两条都没有配前后对照的演示,改善到什么程度,只能自己上手试。

延长

超过 30 秒靠「延长」,但三个官方口径对不上

一条 30 秒当然不够拍一支完整的片子。接着往下做靠的是「延长」:在已经生成好的视频后面接着长,人物、场景、画面风格和声音都跟前面保持一致,省掉自己拆分镜、反复拼接、处理衔接的那几道工序。

延长演示:小男孩抱着足球沿车厢跑,地铁停稳门开他冲出去,男主一路追到街上,最后追上、小男孩委屈抬头、男主消气摸头。指令原话:「延长视频,衔接 @视频 1 画面内容和主体继续生成一个 30 秒的视频,保持人物主体、场景、画面风格、声音音效一致。」来源:Seedance 2.5 发布博客。

到底能延长到多久,三个地方给的说法不一样,而且没有互相解释。发布博客写的是「支持多轮延长」,能生产「数分钟」的连贯内容;Seedance 2.5 项目主页写的是「支持两次视频延长」;即梦和它的国际版 Dreamina 则在平台侧另给了一个「超长视频模式」,最长 3 分钟。

模型单次生成 · 发布博客与项目主页 30 秒 项目主页:「支持两次视频延长」 ≈90 秒 30×3,本站按「两次」算的 即梦 / Dreamina:「超长视频模式」 3 分钟 发布博客:「多轮延长」「数分钟」 没给数字,这一栏画不出长度 060 秒 120 秒180 秒 深色=官方给的数;浅色=本站推算
三处说法与模型单次上限并置,横轴按秒等比、底下有刻度可对。90 秒那一根是本站按「支持两次延长」推算的,没有一处写过 90 秒;「数分钟」那一条官方没给数字,所以没有画长度。

我的读法是:模型本体给的是 30 秒加两次延长,3 分钟是即梦和它的国际版 Dreamina 在平台侧另做的一个模式,官方账号 Dreamina AI(@dreamina_ai) 那条上线推文也把它当独立功能写,「Long video mode: up to 3 minutes」。三处说法谁涵盖谁,官方没有明确说过。

指令

你要写的东西变了:指令现在是一张按秒分段的分镜表

时长、参考、编辑是这次摆在明面上的三件事。但把几条演示指令摊开摆在一起看,还有一件没被点名的变化:现在的指令要按秒分段,还要给每份素材编号。

早餐那条演示的指令长这样:

早餐那条的完整编辑指令
编辑 @视频 1,保持人物、动作及画风不变,仅调整运镜。15 秒分段运镜设计:0–4 秒,微型 FPV 贴锅穿行,跟随弹起的吐司后横甩至咖啡;4–7 秒,推近并沿锅边横移,跟随煎蛋翻起落回;7–11 秒,急速升至顶视角,匀速下压扫过餐盘和钥匙;11–15 秒,手持近镜跟随双手快速横甩,最后推近早餐,再拉回双人中景。全程连贯稳定。
这条同时是两件事的例子:它是一条编辑指令(改的是已经生成好的 @视频 1),而且只动镜头,人物、动作、画风全部保持原样。
00:00–00:04 微型 FPV 贴着锅面穿行 跟着弹起的吐司 横甩到咖啡 00:04–00:07 推近 沿锅边横移 跟着煎蛋 翻起落回 00:07–00:11 急速升到顶视角 再匀速下压 扫过餐盘 和钥匙 00:11–00:15 手持近镜 跟着双手横甩 推近早餐 收在双人中景 0s4s7s 11s15s 四段的边界由指令自己写死,卡片宽度与刻度按秒等比
早餐那条指令的四段结构,卡片宽度与下方刻度按秒等比。时间点和镜头动作全部来自指令本身。
运镜编辑演示:同一段早餐画面,人物和动作不变,只按上面那四段重新设计镜头。来源:Seedance 2.5 发布博客。

京剧那条也是同一个写法:「0-5 秒:@图片 2 霸王近景开场……6-10 秒:镜头稳定环绕 @图片 1 虞姬中景……11-20 秒:@图片 3 武生出场完成后空翻腾动作」。两个共同点:按秒分段给素材编号

时间戳

你在这里写的已经是一张分镜脚本了:有时间轴,有素材表,每一段规定死了发生什么。发布页把这件事写成「精准的时间戳控制」,生成时按时间段规定这一段发生什么故事、什么视角、什么运镜、什么节奏;生成之后还能挑出某个片段,单独改里面的角色、动作、声音或者剧情,同时保持改动前后连贯。

动手的门槛降了,不用会拍、会剪、会打光。说清楚的门槛升了,你得先在脑子里把分镜排出来,还要会用文字把它写准。生成一次不满意就整条重来,圈里管这叫「抽卡」;指令细到按秒,能不能抽到想要的,就多了一个变量:你写没写清楚第几秒该发生什么。

时间戳能精确到多少,发布博客没给数字。Dreamina AI(@dreamina_ai) 那条推文写的是精确到 1 秒(「precise timestamp control down to 1 second」),这是平台自己的说法。

参考

一条指令,给 18 张参考图各派一个角色

指令写细了,喂进去的素材也得跟上。单次能输入的参考素材从上一代的 9 张图 + 3 段视频 + 3 段音频(一共 15 个),涨到 30 张图 + 10 段视频 + 10 段音频(一共 50 个)。光是图,就从 9 张变成 30 张。

50 个位子听着很抽象。音乐会那条演示用掉了其中 18 张图,一条指令里给它们各自派了活。

@图一 整个音乐厅的场景 ↑ 舞台后方 合唱团 @图十一 – @图十四 管弦乐队(分布在两侧与后方) @图六 – @图十 钢琴家 @图二 大提琴 @图三 小提琴 @图四 主唱(走向前沿) @图五 舞台前沿 观众席 @图十五 – @图十八 一共 18 张图(含 @图一 场景),17 张绑角色与分区 指令只写了谁在中央、谁在两侧、谁在后方,方块位置是本站排的
音乐会演示里 18 张参考图的分工,按指令的编号排成分区示意。指令只写了谁在中央、谁在两侧、谁在后方,方块的具体排布是本站排的,不是精确的舞台平面图。
音乐会那条的完整生成指令
30 秒音乐会片段,16:9 横屏,电影感写实,真实音乐厅光影,暖金色舞台灯,正式古典音乐会氛围。场景@图一,钢琴家参考@图二,大提琴参考@图三,小提琴参考@图四,主唱参考@图五,管弦等其他乐队参考@图六到图十,合唱团参考图十一到图十四,观众席参考@图十五到图十八。主唱舞台中央走向前沿,钢琴家在钢琴旁,乐队分布两侧与后方,合唱团在舞台后方。开场高位俯拍音乐厅全景,钢琴家落键,主唱进入追光演唱,镜头自然带过小提琴、大提琴与管弦乐队,小提琴明亮,大提琴温暖。后段合唱团加入,主唱与第一排观众短暂眼神交流,观众微笑点头。结尾镜头后移,演唱结束,观众跟随鼓掌。
这条指令干了三件事:把 18 张图分派到各个角色和区域、规定每个人站哪儿、再排一遍镜头怎么走。前五张是单独点名的,后面十三张按组绑定,管弦、合唱团、观众席各拿一段编号区间。
多人同框的群像演示:多个人物的形象和声音同时还原,各自特征在整段里保持稳定。来源:Seedance 2.5 发布博客。

数量之外,参考能力本身也提升了几类:白模参考、运动参考、创意参考。运动参考和创意参考只给了名字,没有进一步说明,也没有配演示;白模参考有完整演示,下面单讲。

流程

白模和绿幕:你在三维软件和绿布前做好的东西,能直接喂进去

白模参考属于参考能力,绿幕编辑属于编辑能力,两者本来分在两处。项目主页把它们并排摆进了「为专业视频创作而生」这一栏,因为它们冲的是同一件事:接上专业制作已经在用的那套东西。这两个词也最挡人,先讲清楚是什么。

白模:先把骨架摆好,再让模型上色

白模就是没有贴图、没有材质的灰白 3D 模型,只剩形状和位置。做影视、广告、游戏的人本来就有这一步:先在三维软件里用灰模把场景搭出来,把机位、人物走位、构图、运动轨迹全部摆定,这叫预演。现在可以把这套白模直接喂进去,让模型照着这套结构生成画面,谁站哪儿、镜头怎么绕、物体沿什么轨迹动,都按你摆好的来,复杂镜头的构图和调度因此更接近预期。

打个比方

像拍电影之前,先用积木和小人在桌上把走位摆一遍。以前摆完了得靠导演在现场重新还原一次,现在可以直接把这张桌子递给模型,让它照着摆好的样子拍出来。

同一套能力里还带了光照:模型能从白模的空间信息推出符合真实物理规律的光照效果,包括光源方向、色温、强度、阴影投射。

你摆好的白模:只有形状、机位和轨迹 机位 主体 运动轨迹 机位环绕弧 模型照着这套骨架渲染出的成片 光源方向 · 色温 · 强度 阴影落在光源的反侧 同一套几何关系:左边的机位、轨迹、主体,右边原样保留 材质、光照、阴影由模型按白模的空间信息补上 示意图,不是官方素材;实际白模与成片见下方演示视频
白模参考的两层关系,本站画的示意图。左边的机位、轨迹、主体由创作者定,右边原样保留这套几何,只补材质、光照和阴影。
白模那条的完整生成指令
参考 @白模 1 的运镜、镜头节奏、景别变化、主体轨迹和镜头调度。参考 @图片 2 的角色外形、场景、材质、光照、色彩和童话氛围,将白模渲染为梦幻温暖、儿童幻想感、3D 动画短片。剧情依次为:幻想天空飞行→云海神兽伴飞→俯冲入海→鳐鱼海底穿梭→镜面时空裂缝→宇宙摘星→幻化回房间→爸爸盖被→合上绘本定格。
两份素材各管一摊:白模管镜头和轨迹,另一张参考图管外形、材质、光照和氛围,剧情用箭头串成一条链。
白模参考演示:一段灰模预演被渲染成儿童幻想风格的 3D 动画短片,镜头调度沿用白模里摆好的那套。来源:Seedance 2.5 发布博客。

绿幕:换掉背景,连衣服怎么飘一起重算

绿幕编辑处理的是另一种已有素材:演员在绿布前拍好的片段。模型帮你把绿幕换成真实场景,同时替换障碍物、服装和配角。关键在于它不只是抠图贴背景,衣服往哪个方向飘、头发是什么状态、步态节奏、光影落在人身上的样子,都会按新场景的物理规则重新算一遍,让主体和场景对得上。

绿幕编辑演示:同一段足球训练素材被换成三段场景,户外训练(障碍换成石头、砖块、轮胎、木箱)、休息室(朋友鼓励)、国际赛场(训练杆换成防守球员和门将,主角进球)。来源:Seedance 2.5 发布博客。

白模和绿幕指向的是同一件事:你在三维软件里摆好的骨架、在绿布前拍好的素材,能直接接着往下用。Dreamina AI(@dreamina_ai) 当天的上线推文里给了配套动作,为 Maya 和 Blender 做的插件,冲的就是影视级生产管线。

落地

课堂里已经在用,工业那边还只是列了用途

那它现在具体在哪儿干活?教育和工业各给了一条演示,但这两条的成色不一样。

教育:把课文背后的场景直接演出来

模型已经进了豆包爱学 App 的「豆包课堂」。做法是把课文背后的历史背景、人物和情节变成画面,让学习内容从静态讲解变成能看的场景;另一头是帮老师做教学视频,把科学原理、历史事件、实验过程这类抽象内容做成动态演示,降低教学素材的制作门槛,也能按需要改。

豆包课堂的场景示例:东方写意风格的南宋临安街景,孩子们边跑边念「蓦然回首,那人却在,灯火阑珊处」,镜头上摇是辛弃疾回头,远处灯火阑珊里站着一个男子。来源:Seedance 2.5 发布博客。

工业、机器人、自动驾驶:用它造训练用的视频

工业那边是另一类用法:用它生成的视频拿去训练机器人怎么看、怎么动手;也能做工业仿真、流程培训和设备演示;自动驾驶那边用来模拟极端天气、复杂路况这类现实中不常遇到的场景,给系统测试补样本。这一段全是「可以」和「能」,没有给出任何已经在跑的客户、数量或时间。

工业场景演示:一段汽车拼装白模被渲染成高端真实的装配片段。用的还是白模那套能力,运镜、构图、景别(镜头拉多近)、零件位置、装配顺序和运动轨迹全部参考白模,材质、光照、色彩和反射参考另一张图。来源:Seedance 2.5 发布博客。
上线

在哪能用上

发布博客的说法是「正在陆续上线」,国内和海外同一天都有动作。

渠道状态怎么进 / 门槛
即梦 AI当天上线网页端 → 视频生成 → 选 Seedance 2.5。平台侧另有「超长视频模式」,最长 3 分钟(这条出自 Dreamina AI(@dreamina_ai) 的上线推文)
豆包专业版当天上线视频生成 → 选 Seedance 2.5。据 PChome 报道,加强套餐与高级套餐用户可优先调用「创意视频」技能,并与 Seedream 5.0 Pro 等模型联动
火山方舟 API还没上发布博客写的是「也将在近期上线」,发布当天没有开放,价格没有公布
Dreamina(国际版)当天上线向 Dreamina 订阅用户开放,首批覆盖东南亚、中东、非洲、欧洲、南美,其余地区陆续开放;同时放出 Maya 与 Blender 插件
豆包专业版里跟它联动的那个图像模型
字节跳动发布 Seedream 5.0 Pro:一张图可拆十余个独立图层,密集图表实景一次生成
同一个团队的图像侧模型,7 月 8 日发布。视频要参考图,图从哪来是同一条链上的事。
🧰 上手卡 · Seedance 2.5
价格官方没公布定价。即梦与豆包专业版走各自的套餐;Dreamina 国际版按每次生成扣积分,只对订阅用户开放。火山方舟 API 尚未上线
上手门槛网页端选模型即可,不用部署;但要出好结果,得会写按秒分段、带素材编号的分镜式指令
四条可以整段抄走的演示指令:歌手一镜到底、早餐运镜编辑、音乐会 18 图派角色、白模渲染童话短片。写法是按秒分段、给每份素材编号、把镜头调度和外观参考分开写。
来源
一镜成片,随心参考|Seedance 2.5 正式发布ByteDance Seed·seed.bytedance.com·2026-07-31
本站说明
10 段演示视频均来自 Seedance 2.5 发布博客,原始文件码率过高(1080p 最高到 51 Mbps,总计 811MB),本站转码压缩到 126MB 后自托管,画面内容未改。上一代 15 个参考素材、15 秒时长等对照数字来自 Seedance 2.0 发布博客。「两次视频延长」与「为专业视频创作而生」出自 Seedance 2.5 项目主页;「超长视频模式最长 3 分钟」与「时间戳精确到 1 秒」出自 Dreamina 国际版推文,是平台自己的说法;豆包专业版套餐门槛来自 PChome 报道。上一代已具备视频编辑与延长能力这一点,出自 Seedance 2.0 发布博客。图中 90 秒一栏为本站按「两次延长」推算,官方未给此数。五个叙事节拍与时间轴的对应、白模两层结构图、音乐会舞台位置图均为本站画的示意图。