字节跳动发布 Seedance 2.5:单次 30 秒直出,一条指令能同时指挥 50 个参考素材
即梦与豆包专业版当天上线,火山方舟 API 还没上,价格也没公布。
- 以前一条只有 15 秒,够拍一个镜头;想拍一场戏,得自己拆开抽、再拼。现在一条 30 秒能装完一场戏。
- 一次能喂进去的参考素材从 15 个涨到 50 个,一条音乐会演示里,18 张图各自被派了活。
- 你要写的东西也跟着变了:现在的指令按秒分段,还要给每份素材编号。
时长翻一倍、参考素材涨到三倍多,改片子能定位到第几秒
字节跳动 Seed 团队 7 月 31 日发布了新一代视频创作模型 Seedance 2.5。对做视频的人来说,这次变的不只是画质:一条视频能装下一整场戏,一次能同时指挥几十份参考素材,改片子的时候还能定位到第几秒。
开场先甩了一部 4 分 22 秒的短片,全片由 Seedance 2.5 独立生成,没有实拍素材。同一条片子也是官方账号 ByteDance Seed(@ByteDanceSeed_) 当天那条推文的内容。这里先留个疑问:4 分 22 秒远超单次生成的 30 秒,它是怎么接起来的,发布页没有交代。
上一代 Seedance 2.0 发布于 2026 年 2 月 12 日,隔了五个多月。底层没换架构,还是同一套多模态音视频联合生成,文字、图片、音频、视频四种输入一起吃。往前推的是三件事:一条能讲多长、一次能参考多少、改片子能改到多细。第三件要说清楚,上一代就能挑出片段、角色、动作或剧情来改,这一代新增的是按时间戳定位,以及绿幕、视角与运镜、参考这几类编辑的增强。
这 30 秒里能跑完一场戏:铺垫、推进、转折、收尾
时长翻倍这件事,听起来只是把 15 秒改成 30 秒。真正被强调的是这 30 秒装的东西不一样了,它要在一条镜头里组织好几个有前后关系的画面,把一个故事从铺垫、推进、转折走到收尾,而不是把同一个画面拖长一倍。
演示是一段女歌手登台。镜头从红色厚幕布的缝隙里推进去,进到暖色的后台化妆间,她背对镜头整理耳机,工作人员提醒她准备上场;她回头看向镜头,开口唱起 City Pop;镜头后退跟着她穿过幕布、走进后台通道,和舞伴自然互动,有人把麦克风递过来;然后两人一起登台,镜头绕到背面,红黑两色的舞台布景、LED 屏、追着人走的聚光灯、烟雾、反光地板一层层展开;最后拉远到体育馆全景,满场观众、灯牌和荧光棒。
一镜到底手持稳定器跟拍,镜头从红色厚重幕布缝隙缓缓推进,进入暖色后台化妆间。年轻女歌手背对镜头整理耳机,工作人员提醒她准备登台。她回头看向镜头,开始唱起 City Pop。镜头后退跟拍,歌手穿过幕布进后台通道,与舞伴自然互动,一位工作人员把麦克风递给她。随后歌手与舞伴登上舞台,镜头绕至背面,红黑舞美、LED 屏、追光、烟雾与反光地板逐渐展开。镜头最终拉远至体育馆全景,呈现满场观众、灯牌、荧光棒与欢呼声,营造年轻自由的演唱会高潮氛围。
镜头绕人转一圈,人和背景不会变样
视频一长,最容易露馅的是主体自己会变:转个身脸就换了,衣服花纹对不上,背景也漂了。京剧那条演示专挑这件事演,镜头伴着主角旋身、水袖甩起完成一次环绕运镜,人和背景在整个过程里保持一致,水袖在空中划出的弧线也贴着重力走。
专门治了一遍「油腻感」
AI 视频有一种一眼就能认出来的假:皮肤太滑像打了蜡,眼神发直,颜色饱和度过头,整个画面像抹了一层油。这次对物体材质、人物肤质与眼神、光影、画面饱和度做了一轮优化,目标是更接近实拍的质感。同一批改动还治了另一个常见毛病:生成视频时凭空多出一行字幕,或者自己冒出一段配乐。这两条都没有配前后对照的演示,改善到什么程度,只能自己上手试。
超过 30 秒靠「延长」,但三个官方口径对不上
一条 30 秒当然不够拍一支完整的片子。接着往下做靠的是「延长」:在已经生成好的视频后面接着长,人物、场景、画面风格和声音都跟前面保持一致,省掉自己拆分镜、反复拼接、处理衔接的那几道工序。
到底能延长到多久,三个地方给的说法不一样,而且没有互相解释。发布博客写的是「支持多轮延长」,能生产「数分钟」的连贯内容;Seedance 2.5 项目主页写的是「支持两次视频延长」;即梦和它的国际版 Dreamina 则在平台侧另给了一个「超长视频模式」,最长 3 分钟。
我的读法是:模型本体给的是 30 秒加两次延长,3 分钟是即梦和它的国际版 Dreamina 在平台侧另做的一个模式,官方账号 Dreamina AI(@dreamina_ai) 那条上线推文也把它当独立功能写,「Long video mode: up to 3 minutes」。三处说法谁涵盖谁,官方没有明确说过。
你要写的东西变了:指令现在是一张按秒分段的分镜表
时长、参考、编辑是这次摆在明面上的三件事。但把几条演示指令摊开摆在一起看,还有一件没被点名的变化:现在的指令要按秒分段,还要给每份素材编号。
早餐那条演示的指令长这样:
编辑 @视频 1,保持人物、动作及画风不变,仅调整运镜。15 秒分段运镜设计:0–4 秒,微型 FPV 贴锅穿行,跟随弹起的吐司后横甩至咖啡;4–7 秒,推近并沿锅边横移,跟随煎蛋翻起落回;7–11 秒,急速升至顶视角,匀速下压扫过餐盘和钥匙;11–15 秒,手持近镜跟随双手快速横甩,最后推近早餐,再拉回双人中景。全程连贯稳定。
京剧那条也是同一个写法:「0-5 秒:@图片 2 霸王近景开场……6-10 秒:镜头稳定环绕 @图片 1 虞姬中景……11-20 秒:@图片 3 武生出场完成后空翻腾动作」。两个共同点:按秒分段,给素材编号。
你在这里写的已经是一张分镜脚本了:有时间轴,有素材表,每一段规定死了发生什么。发布页把这件事写成「精准的时间戳控制」,生成时按时间段规定这一段发生什么故事、什么视角、什么运镜、什么节奏;生成之后还能挑出某个片段,单独改里面的角色、动作、声音或者剧情,同时保持改动前后连贯。
动手的门槛降了,不用会拍、会剪、会打光。说清楚的门槛升了,你得先在脑子里把分镜排出来,还要会用文字把它写准。生成一次不满意就整条重来,圈里管这叫「抽卡」;指令细到按秒,能不能抽到想要的,就多了一个变量:你写没写清楚第几秒该发生什么。
时间戳能精确到多少,发布博客没给数字。Dreamina AI(@dreamina_ai) 那条推文写的是精确到 1 秒(「precise timestamp control down to 1 second」),这是平台自己的说法。
一条指令,给 18 张参考图各派一个角色
指令写细了,喂进去的素材也得跟上。单次能输入的参考素材从上一代的 9 张图 + 3 段视频 + 3 段音频(一共 15 个),涨到 30 张图 + 10 段视频 + 10 段音频(一共 50 个)。光是图,就从 9 张变成 30 张。
50 个位子听着很抽象。音乐会那条演示用掉了其中 18 张图,一条指令里给它们各自派了活。
30 秒音乐会片段,16:9 横屏,电影感写实,真实音乐厅光影,暖金色舞台灯,正式古典音乐会氛围。场景@图一,钢琴家参考@图二,大提琴参考@图三,小提琴参考@图四,主唱参考@图五,管弦等其他乐队参考@图六到图十,合唱团参考图十一到图十四,观众席参考@图十五到图十八。主唱舞台中央走向前沿,钢琴家在钢琴旁,乐队分布两侧与后方,合唱团在舞台后方。开场高位俯拍音乐厅全景,钢琴家落键,主唱进入追光演唱,镜头自然带过小提琴、大提琴与管弦乐队,小提琴明亮,大提琴温暖。后段合唱团加入,主唱与第一排观众短暂眼神交流,观众微笑点头。结尾镜头后移,演唱结束,观众跟随鼓掌。
数量之外,参考能力本身也提升了几类:白模参考、运动参考、创意参考。运动参考和创意参考只给了名字,没有进一步说明,也没有配演示;白模参考有完整演示,下面单讲。
白模和绿幕:你在三维软件和绿布前做好的东西,能直接喂进去
白模参考属于参考能力,绿幕编辑属于编辑能力,两者本来分在两处。项目主页把它们并排摆进了「为专业视频创作而生」这一栏,因为它们冲的是同一件事:接上专业制作已经在用的那套东西。这两个词也最挡人,先讲清楚是什么。
白模:先把骨架摆好,再让模型上色
白模就是没有贴图、没有材质的灰白 3D 模型,只剩形状和位置。做影视、广告、游戏的人本来就有这一步:先在三维软件里用灰模把场景搭出来,把机位、人物走位、构图、运动轨迹全部摆定,这叫预演。现在可以把这套白模直接喂进去,让模型照着这套结构生成画面,谁站哪儿、镜头怎么绕、物体沿什么轨迹动,都按你摆好的来,复杂镜头的构图和调度因此更接近预期。
像拍电影之前,先用积木和小人在桌上把走位摆一遍。以前摆完了得靠导演在现场重新还原一次,现在可以直接把这张桌子递给模型,让它照着摆好的样子拍出来。
同一套能力里还带了光照:模型能从白模的空间信息推出符合真实物理规律的光照效果,包括光源方向、色温、强度、阴影投射。
参考 @白模 1 的运镜、镜头节奏、景别变化、主体轨迹和镜头调度。参考 @图片 2 的角色外形、场景、材质、光照、色彩和童话氛围,将白模渲染为梦幻温暖、儿童幻想感、3D 动画短片。剧情依次为:幻想天空飞行→云海神兽伴飞→俯冲入海→鳐鱼海底穿梭→镜面时空裂缝→宇宙摘星→幻化回房间→爸爸盖被→合上绘本定格。
绿幕:换掉背景,连衣服怎么飘一起重算
绿幕编辑处理的是另一种已有素材:演员在绿布前拍好的片段。模型帮你把绿幕换成真实场景,同时替换障碍物、服装和配角。关键在于它不只是抠图贴背景,衣服往哪个方向飘、头发是什么状态、步态节奏、光影落在人身上的样子,都会按新场景的物理规则重新算一遍,让主体和场景对得上。
白模和绿幕指向的是同一件事:你在三维软件里摆好的骨架、在绿布前拍好的素材,能直接接着往下用。Dreamina AI(@dreamina_ai) 当天的上线推文里给了配套动作,为 Maya 和 Blender 做的插件,冲的就是影视级生产管线。
课堂里已经在用,工业那边还只是列了用途
那它现在具体在哪儿干活?教育和工业各给了一条演示,但这两条的成色不一样。
教育:把课文背后的场景直接演出来
模型已经进了豆包爱学 App 的「豆包课堂」。做法是把课文背后的历史背景、人物和情节变成画面,让学习内容从静态讲解变成能看的场景;另一头是帮老师做教学视频,把科学原理、历史事件、实验过程这类抽象内容做成动态演示,降低教学素材的制作门槛,也能按需要改。
工业、机器人、自动驾驶:用它造训练用的视频
工业那边是另一类用法:用它生成的视频拿去训练机器人怎么看、怎么动手;也能做工业仿真、流程培训和设备演示;自动驾驶那边用来模拟极端天气、复杂路况这类现实中不常遇到的场景,给系统测试补样本。这一段全是「可以」和「能」,没有给出任何已经在跑的客户、数量或时间。
在哪能用上
发布博客的说法是「正在陆续上线」,国内和海外同一天都有动作。
| 渠道 | 状态 | 怎么进 / 门槛 |
|---|---|---|
| 即梦 AI | 当天上线 | 网页端 → 视频生成 → 选 Seedance 2.5。平台侧另有「超长视频模式」,最长 3 分钟(这条出自 Dreamina AI(@dreamina_ai) 的上线推文) |
| 豆包专业版 | 当天上线 | 视频生成 → 选 Seedance 2.5。据 PChome 报道,加强套餐与高级套餐用户可优先调用「创意视频」技能,并与 Seedream 5.0 Pro 等模型联动 |
| 火山方舟 API | 还没上 | 发布博客写的是「也将在近期上线」,发布当天没有开放,价格没有公布 |
| Dreamina(国际版) | 当天上线 | 向 Dreamina 订阅用户开放,首批覆盖东南亚、中东、非洲、欧洲、南美,其余地区陆续开放;同时放出 Maya 与 Blender 插件 |
写给 AI 的指令,正在变成一张按秒分段的分镜表
字节跳动发布视频模型 Seedance 2.5:一条 30 秒、一次喂 50 份素材,一页带图讲完。
↓ 一页读完 · 有一张会动的图
Seedance 2.5 是字节跳动 Seed 团队 7 月 31 日发布的视频生成模型,你给文字和参考素材,它直接出带声音的成片。上一代 Seedance 2.0 发布于 2 月 12 日,底层架构没换,往前推的是三件事:一条能讲多长、一次能参考多少、生成完能改到多细。
参考素材 9 图 + 3 视频 + 3 音频 = 15 个
改片子 挑片段 / 角色 / 动作 / 剧情改
参考素材 30 图 + 10 视频 + 10 音频 = 50 个
改片子 再加「按第几秒定位」
时长翻倍不是把同一个画面拖长一倍。官方演示里,一条 30 秒装完了一整场戏:镜头从幕布缝里推进化妆间,歌手回头开唱,镜头后退跟她穿过后台通道,登台绕到背面展开舞美,最后拉远到体育馆全景,中间不剪。这次的另一项改动专治 AI 视频那种一眼假的塑料感:皮肤太滑、眼神发直、颜色过饱和,一并调了材质、肤质、光影和饱和度,没有配前后对照的演示。
把几条演示指令摊开摆在一起,还有一件没被点名的变化:现在的指令要按秒分段写,还要给每份素材编号。下面这张是官方「早餐运镜」那条演示的原始指令结构,四段边界是写指令的人自己定死的。
动手的门槛降了,不用会拍、会剪、会打光。说清楚的门槛升了,你得先在脑子里把分镜排出来,再用文字写准。生成一次不满意就整条重来,圈里管这叫抽卡;指令细到按秒,能不能抽到想要的,就多了一个变量。
参考素材涨到 50 个,听着抽象。官方那条音乐会演示用掉了其中 18 张图,一条指令里把它们各自派了活,每张图都绑定到一个角色或一片区域,像给每个人发身份证。
参考还多了两类专冲专业流程的用法。白模是没贴图没材质的灰白 3D 模型,影视和游戏本来就会先在三维软件里用它摆好机位、走位和运动轨迹,现在这套骨架能直接喂进去让模型照着上色,连光源方向、色温、强度和阴影都按白模的空间关系算。绿幕编辑吃的是绿布前拍好的素材,换背景、换障碍、换服装、换配角,并按新场景重算衣服怎么飘、头发什么状态、步态和光影。Dreamina 同日放出了 Maya 与 Blender 插件。
即梦 AI 和豆包专业版当天就能选到这个模型,网页端选一下就用,不用部署;国际版 Dreamina 同日全球上线,向订阅用户开放。火山方舟的 API 写的是「近期上线」,发布当天没开放,价格也没公布。
数字是谁给的:30 秒、50 个参考素材、两次延长、4 分 22 秒开场短片,全部出自字节跳动 Seed 的发布博客与 Seedance 2.5 项目主页;3 分钟与 1 秒时间戳精度是即梦、Dreamina 平台自己的说法;豆包专业版的套餐门槛来自 PChome 报道。第三方独立实测目前没有。
上一代 2 月发的。
架构没换,往前推了三件事。
上一代 15 秒。
钢琴家 @图二 大提琴 @图三
主唱 @图五
合唱团 @图十一到图十四
观众席 @图十五到图十八
参考素材上限:
30 图 + 10 视频 + 10 音频。
上一代 15 个。
写的人自己切成四段。
生成完还能指着第几秒改,
不用整条重抽。
说清楚的门槛升了。
- × 发布博客:多轮延长,数分钟
- × 项目主页:支持两次视频延长
- × 即梦与 Dreamina:超长模式 3 分钟
