Black Forest 发布 FLUX 3 Video:能力匹敌 Seedance 2.0,音画同出,支持十几种语言
最长 20 秒、24 帧、原生 HD;三种调用方式共用一个接口;视频续写比从头生成贵 2.5 倍还短 5 秒。跑分是 BFL 自评。
- 画面和声音是同一次生成里一起出来的,嘴型对得上,十几种语言都行。
- 先花三分之一的钱抽草稿,选中哪条再原样重渲成全画质,重渲不会变样,这才是它值钱的地方。
- 价目表里有一条发布页没写的:视频续写每秒 $0.43,是从头生成的 2.5 倍,还比另外两种短 5 秒。
FLUX 3 Video 核心能力
Black Forest Labs 发布了 FLUX 3 Video:写一段话,或者给一张图,直接出一条带声音的视频。最大的亮点是原生多模态,画面和声音(背景音、音效、台词)是同一次生成里一起出来的,嘴型能对上。单次最长 20 秒、24 帧,原生 HD,可以再升一档到 Full HD(1920×1088)。今天起 BFL 的 API 谁都能调,另外还接入了一批没点名的合作平台,价格全公开。
能力清单先一次摆完,后面每一条都会单独展开:
写一段话,或者给 1 到 10 张图,出连贯的动作和跟得上的音效。
可以指定开头、结尾,或者中间任意时刻的画面;也能丢一段 4 秒以内的旧片子,让它往后接着演。
同一次生成里包含好几个机位和运镜角度,不用从头到尾守着一个固定机位。
点名支持英语(多种口音)、中文、西班牙语、法语、德语、日语、葡萄牙语、俄语、意大利语、印尼语、土耳其语、印地语、旁遮普语,说台词时嘴唇动作对得上。
分辨率填 fhd 会再过一道超分放大(upsampler,先按较低分辨率生成,再用一个专门的模型放大补细节),16:9 输出 1920×1088。
草稿便宜到三分之一,选中哪条再一键渲成全画质,主体、构图、运动都不变。
一条 10 秒的高清片子约 1.7 美元。视频续写另算,每秒 $0.43 起,这一条后面单独说。
FLUX 3 这个模型本身 7 月底就公布过,当时视频线还是申请制,图像线和开放权重都排在后面。这次是它真正开门营业。
顺带看一眼它的调性范围
官方博客开头没讲技术,直接甩了四条完全不搭界的片子:一头熊在林子里走、一台老式显像管终端自己打字、一段手绘的太空望远镜动画、一匹马在暗底光里慢跑。BFL 给的说法是,现实本来就不长一个样,每一种画面、每一种声音都只截取了它的一个碎片,所以模型不该只会拍好莱坞预告片。
> initalizing system… > loading kernel modules… OK。10 秒。来源:Black Forest Labs终端那条片子里有个细节值得记一笔:屏幕上打出来的第一行是 initalizing,少了一个 i。而「画面里的文字准确」正是这次宣传的能力之一。是提示词本来就这么拼,还是模型自己拼错的,材料里没有交代。
三种调用方式:文生视频、图生视频、视频续写
这三种用法其实是同一个接口。所有请求都发到 POST /v1/flux-3-video,请求体长得一模一样,唯一的区别是 mode 字段填什么,而你填的,其实是「我手上有什么」:
官方文档还做了一件挺聪明的事,拿同一个场景把三种模式串了一遍。先用 t2v 生成一段「她拉着他笑着跑过挂满灯笼的巷子」;再把这条片子的第一帧抠出来喂给 i2v,配一句新的运镜指令,得到同一个开头、完全不同的一条片;最后把整段原片丢给 v2v,让这对人冲出巷子进夜市。后一个请求吃的就是前一个的产物,四条片子层层叠上去,一看就明白三者是什么关系。
curl -X POST https://api.bfl.ai/v1/flux-3-video \
-H "x-key: $BFL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"mode": "t2v",
"prompt": "she takes his hand and pulls him laughing
through the lantern-lit alley, the camera
chasing them, paper lanterns swaying overhead",
"duration": 8
}'
把 mode 换成 i2v 或 v2v,再多给一个 keyframes 或 start_video 字段,就是另外两种用法。其余全都可以不填:画幅和时长默认 auto(让模型自己看着办),分辨率默认 hd,声音默认开着。
先看最基础的文生视频。官方挑的这条演示不走温柔路线,一栋房子被装在碰撞试验的滑车上,整个撞进水泥墙里:
再看视频续写。这一路的规矩是:你交一段最长 4 秒的旧片子,再告诉它接下来该发生什么,它把运动、机位、对白和声音一起往后接。官方这条演示把接缝直接标在画面上:前 4 秒是原始素材,第 4 秒往后全是生成的,一条海滨大道的行车记录仪画面,接着接着就冲出来一头驼鹿:
关键帧:最多钉 10 张图,中间由模型补
图生视频这一路的设计和别家不太一样:它没有单独的「首帧」字段。图片全部从 keyframes 这一个字段进去,你给几张、钉在哪一秒,就决定了它是哪种用法。
- 给 1 张:这张就是开头。
- 给 2 张:一头一尾,中间那段路由它自己走。
- 最多给 10 张:等于交了一份分镜。
- 写成
[秒数, 图片]这样的一对一对:把某张图钉死在第 4 秒。
官方这条演示自带时间轴,把机制直接演在画面上:三个关键帧钉在 0:00、0:04、0:10,字幕写着 FLUX 3 interpolates the keyframes(FLUX 3 在补关键帧之间的画面)。第三张缩略图里,那艘红色小帆船已经翻了,你只管钉三个点,中间怎么进水、怎么翻,是它编的。
只钉首尾的版本更能看出它自己编了多少:左边 START FRAME 是一间空屋子,右边 END FRAME 是布置好的客厅,中间写着 FLUX 3 fills the in-between(中间由 FLUX 3 填)。家具像折纸一样从地板上展开,这段变形完全没人指定过。
原生音频:声音和画面一起生成,所以口型能对上
为什么以前的 AI 视频,一到人物开口说话就露馅?问题出在做法上,过去是一条三段流水线,一步扣一步:
- 第一步生成画面。这时候模型手里还没有声音,它并不知道那句台词到底是什么节奏、哪个字重、哪里停顿。
- 第二步换一个语音模型把台词读出来。这个模型也看不见画面,它只管把字读得像人。
- 第三步再想办法把嘴唇动作和声音对齐。到这一步已经是打补丁了,能对个大概,对不到每一个音节。
三步之间有两道接缝,每一道都可能错开一点。所以老办法最怕拍近景人脸,嘴型和声音差半拍,观众一眼就出戏。
不断。对白、音效、环境音跟每一帧一起生成,是同一次生成里的产物。嘴唇怎么动、声音怎么响,来自同一个模型状态,中间不存在「事后对齐」这一步。
接口这一层也是按「默认要声音」设计的:generate_audio 不填就是 true,你拿到的就是有声视频,不需要额外开关。
语言这块点名了十三种:英语(多种口音)、中文、西班牙语、法语、德语、日语、葡萄牙语、俄语、意大利语、印尼语、土耳其语、印地语、旁遮普语,名单后面还跟了个「等等」。韩语不在这份点名名单里,「等等」里覆盖到什么程度,材料里没写。
对白的演示是两个穿西装的男人隔着一张桌子、对着两支老式麦克风争辩,像上世纪的电视辩论现场,整整 20 秒不断:
多语言那条更值得看的其实是另一件事:同一个穿红色雨衣的女生,连着出现在餐厅卡座、夜市小吃摊、自助洗衣店三个场景里说话,同一张脸跨三个镜头没走样。
多镜头切换,以及它认识的真实地点
一条 20 秒的片子里,一只黑猫从卧室的床上跳到沙发,然后镜头直接切到屋外,从街上回看这栋房子的窗户,猫还在窗里,接着再切到花园和灌木丛。镜头是真的换了机位、剪了几刀,前后还接得上,而不只是同一个画面里的推拉摇移。以前要这种效果,得分几段生成再自己剪:
另一条演示对应的能力叫「世界知识 + 实时接地」,卖点是几个词的提示词就能拍纪录片和科普短片。画面看着像德国弗莱堡老城:街边那条窄窄的引水沟(当地叫 Bächle)、红砂岩的哥特式大教堂、一对挂着相机的游客,整条片是八九十年代旅游录像带的味道。片子里没有标地点,不过弗莱堡正是 BFL 自己的总部所在,公司名里的「黑森林」就是那一片山区。
草稿模式:三分之一价格,选中后原样重渲
视频生成有个磨人的地方,试过的人都懂:你写一句提示词,抽到一条还不错的,想再要一条「差不多但更好一点」的,重新提交就是一次全新的生成。主体、构图、运动全都可能变,你刚才喜欢的那条,可能再也抽不出来了。而每抽一次都在烧钱。
草稿模式把这件事拆成两步:
第一步,请求里加 draft: true,拿回一条快速预览。草稿是 1 倍时间、1/3 价钱,全画质要 1.8 倍时间,这三个数字直接印在对比视频的画面上。便宜到你可以放开了多抽几条。
第二步,挑中一条之后,这条草稿的结果里会附一个 draft_cache 包。把它下载下来,模式填 draft_enhance 再发回去,模型就把同一次生成用全画质重渲一遍。
「同一个镜头、同一个种子,什么都不重新解释。」
Black Forest Labs 开发者文档(本站译)
普通的重新生成像重新抽一次卡,抽到什么算什么;draft_cache 相当于给这次抽卡留了个存档点,你要的那条不用再抽,直接读档,然后按最高画质重新渲染一遍。
所以草稿模式卖的不只是打折,它把探索和交付拆成两笔钱:探索按三分之一价随便抽,只有你点头的那一条付全价,而且付全价拿到的,确实是你点头的那一条。
价格表:视频续写每秒 $0.43,是从头生成的 2.5 倍
三种模式的完整价目,全在文档里:
| 模式 | 你给它什么 | 时长 | 全画质 | 草稿 |
|---|---|---|---|---|
| 文生视频 | 一句提示词 | 5–20 秒 | $0.17/秒(hd) $0.29/秒(fhd) | $0.06/秒 |
| 图生视频 | 提示词 + 1–10 张图 | 5–20 秒 | $0.17/秒(hd) $0.29/秒(fhd) | $0.06/秒 |
| 视频续写 | 提示词 + 你的片子 | 5–15 秒 | $0.43/秒(hd) $0.54/秒(fhd) | $0.12/秒 |
三件事直接从表里读得出来:
- 视频续写贵一大截。同样是高清,续写每秒 $0.43,是从头生成 $0.17 的 2.5 倍还多。一条 10 秒的片子,从头生成 1.7 美元,续写要 4.3 美元。为什么贵,文档里没有解释。
- 视频续写还更短。另外两种最长 20 秒,续写封顶 15 秒,少了整整 5 秒。
- 草稿一律按 hd 渲染,没有 fhd 的草稿。
换算成一笔具体的账。一条 10 秒的高清文生视频:
- 直接出全画质:1.7 美元,但你只有一条,不满意就得重抽。
- 盲抽 3 条全画质挑一条:5.1 美元。
- 先抽 3 条草稿,挑中一条再重渲:3 × 0.6 + 1.7 = 3.5 美元,而且定稿的就是你挑的那条。
还有一条容易踩的:生成结果的下载链接是签名的,大约 2 小时后过期。跑完要及时把片子取走,别等到第二天。
跑分:文生视频第一,图生视频与 Seedance 2.0 打平
官方放了一张人评 ELO 榜,两两对打算分。两边的完整排名都在图上:
两边的差距完全不是一回事:
文生视频领先第二名 45 分,是有分量的差距。图生视频那边只高出 2 分,官方自己在正文里用的词也是「打平(ties)Seedance 2.0」,没有写赢。
还有两处值得对着榜单看一眼:
- 文生视频那张榜里没有 Veo 3.1。它出现在图生视频榜的第 8 名(975 分),文生视频那边的十个名额里找不到它,材料里没有说明原因。
- 被拿来比的是 Seedance 2.0。字节在 7 月 31 日已经发过 Seedance 2.5,这张榜没有把它算进来。
这张榜的前提要说清楚:评测由 BFL 自己组织,评的也是自己家的模型排第一,不是第三方榜单。上面那些演示片子都是原样嵌的,可以自己看着判断。
还没上线的功能,和几条限制
文档第一屏就写着,FLUX 3 现在是 preview(预览)状态。已经标出来「即将推出」的有两项:视频编辑,以及 Omni Reference,拿图片和视频当参考素材来控制生成。
路线图再往后是 FLUX 3 Image(图像生成和编辑)和 FLUX 3 Dev(开放权重版本)。开放权重仍然排在最后一位,跟 7 月那次公告的顺序一致。发布推文里另外提到 2K 和 4K 也在路上。
安全这块的做法:发布前找了第三方机构 Cinder 做评估,覆盖非自愿私密影像(NCII)和儿童性虐待材料(CSAM)等风险。接口上有个 safety_tolerance 参数,0 到 4,默认 2,0 最严。有三条硬上限写在文档里,不受你填什么影响:
- 性相关内容最高只到 3 级;
- 仇恨内容最高只到 2 级;
- 只要请求里带了参考图或参考视频,一律压到 2 级。
这次发布页的标题是「FLUX 3 Video, Part 1: Generation」(第一部分:生成)。整篇没有架构、训练方法或技术报告,能查到的只有能力和接口,所以模型内部怎么做到音画同生,目前还没有可核对的材料。
FLUX 3 Video 开卖:声音跟画面在同一次生成里一起出来,草稿选中的那条能原样重渲
Black Forest Labs 把文生视频、图生视频、视频续写做成同一个接口,今天起谁都能调,一页带图讲完能力、机制和价钱。
↓ 一页读完 · 有一张会动的图
写一段话,或者给一张图,直接出一条带声音的视频,背景音、音效、台词都在里面。文生视频、图生视频、视频续写这三种用法共用同一个接口,请求体长得一模一样,只有 mode 这个字段不同,你填的其实是「我手上有什么」:什么都没有、有图、有一段旧片子。
✔ 最多钉 10 张图当关键帧(你提前定死的几张画面),钉子之间的每一帧由模型自己补
✔ 一条片子里自动切几个机位,前后还接得上
✔ 点名支持 13 种语言的台词(英语、中文、日语、德语、印地语等),说话时嘴唇动作对得上
✘ 视频续写封顶 15 秒,比另外两种少 5 秒;能吃进去的旧片子最长 4 秒
✘ 韩语不在点名的语言名单里,名单后面只跟了个「等等」
✘ 发布页标题写着 Part 1: Generation,全篇没有架构和训练细节,模型内部怎么做到音画同生,没有可核对的材料
以前的 AI 视频一到人物开口说话就露馅,问题出在做法上:画面、配音、对齐是三段接力,中间隔着两道接缝,每一道都可能错开半拍,所以最怕拍近景人脸。FLUX 3 把这三件事收进同一次生成,接口也按默认出声设计,generate_audio 不填就是开着。
还不知道台词什么节奏
② 换一个模型把台词读出来
这个模型看不见画面
③ 再想办法把嘴型和声音对齐
到这步已经是打补丁
台词 / 音效 / 环境音
,两条轨来自同一个
模型状态,一起长出来
中间没有「事后对齐」
这一步
视频生成最磨人的地方:抽到一条还不错的,想再要一条差不多但更好一点的,重新提交就是一次全新生成,主体、构图、运动全都可能变,刚才喜欢那条可能再也抽不出来了。草稿模式把这件事拆成两步。
价格全公开。有一条发布页没写、只藏在开发者文档的表里:手上有旧片子想往后接,单价跳到每秒 $0.43。
发布页放了一张人评 ELO 榜(两两对打算出来的相对分,只说明谁在这轮比较里更受偏好,不是绝对质量分)。两项的差距完全是两回事。
- × 先出画面
不知道台词节奏 - × 再换模型读台词
它看不见画面 - × 最后硬对嘴型
已经在打补丁
声音轨
人物换了张脸
镜头飘走了
刚才那条
再也抽不回来
一条都不一定合意。
还没定稿
合 $0.6
✓ 就要这条
按 $0.17/秒 重渲一遍。
同一个镜头、同一个种子,
主体、构图、运动都不变。
单价是从头生成的 2.5 倍,
还封顶 15 秒,少 5 秒。
Seedance 2.0 是 1049。
