产品发布 · 小互解读

Black Forest 发布 FLUX 3 Video:能力匹敌 Seedance 2.0,音画同出,支持十几种语言

最长 20 秒、24 帧、原生 HD;三种调用方式共用一个接口;视频续写比从头生成贵 2.5 倍还短 5 秒。跑分是 BFL 自评。

一分钟速览
  • 画面和声音是同一次生成里一起出来的,嘴型对得上,十几种语言都行。
  • 先花三分之一的钱抽草稿,选中哪条再原样重渲成全画质,重渲不会变样,这才是它值钱的地方。
  • 价目表里有一条发布页没写的:视频续写每秒 $0.43,是从头生成的 2.5 倍,还比另外两种短 5 秒。
⚑ 素材取自 Black Forest Labs 官方发布页与开发者文档,能力描述与跑分均为厂商口径,ELO 榜是 BFL 自己组织的人评,不是第三方评测。文中十四条视频全部来自官方发布页与官方发布推文,本站逐条播放核对过画面、时长与画面内文字。
这是什么

FLUX 3 Video 核心能力

Black Forest Labs 发布了 FLUX 3 Video:写一段话,或者给一张图,直接出一条带声音的视频。最大的亮点是原生多模态,画面和声音(背景音、音效、台词)是同一次生成里一起出来的,嘴型能对上。单次最长 20 秒、24 帧,原生 HD,可以再升一档到 Full HD(1920×1088)。今天起 BFL 的 API 谁都能调,另外还接入了一批没点名的合作平台,价格全公开。

官方发布片:一整段 60 秒的样片拼贴,从夜间车流、水下的手、木工桌面到示波器画面,全部由 FLUX 3 生成,画面里的字幕也是模型渲染的。来源:Black Forest Labs 官方发布推文

能力清单先一次摆完,后面每一条都会单独展开:

生成方式
文生视频 & 图生视频

写一段话,或者给 1 到 10 张图,出连贯的动作和跟得上的音效。

关键帧 & 续写
开头、结尾、中间都能钉死

可以指定开头、结尾,或者中间任意时刻的画面;也能丢一段 4 秒以内的旧片子,让它往后接着演。

镜头
一条片子里自动切多个镜头

同一次生成里包含好几个机位和运镜角度,不用从头到尾守着一个固定机位。

口型 & 语言
自然口型,十几种语言

点名支持英语(多种口音)、中文、西班牙语、法语、德语、日语、葡萄牙语、俄语、意大利语、印尼语、土耳其语、印地语、旁遮普语,说台词时嘴唇动作对得上。

时长 & 清晰度
最多 20 秒,24 帧,原生 HD

分辨率填 fhd 会再过一道超分放大(upsampler,先按较低分辨率生成,再用一个专门的模型放大补细节),16:9 输出 1920×1088。

草稿模式
先出低配预览,满意了再定稿

草稿便宜到三分之一,选中哪条再一键渲成全画质,主体、构图、运动都不变。

价格
草稿 $0.06/秒,全画质 $0.17/秒起

一条 10 秒的高清片子约 1.7 美元。视频续写另算,每秒 $0.43 起,这一条后面单独说。

FLUX 3 这个模型本身 7 月底就公布过,当时视频线还是申请制,图像线和开放权重都排在后面。这次是它真正开门营业。

站内相关
Black Forest Labs 发布 FLUX 3:图像、视频、声音、机器人押在同一个模型上
7 月那次公告讲的是这个模型为什么要把四件事塞进一套权重,以及当时的开放节奏。

顺带看一眼它的调性范围

官方博客开头没讲技术,直接甩了四条完全不搭界的片子:一头熊在林子里走、一台老式显像管终端自己打字、一段手绘的太空望远镜动画、一匹马在暗底光里慢跑。BFL 给的说法是,现实本来就不长一个样,每一种画面、每一种声音都只截取了它的一个碎片,所以模型不该只会拍好莱坞预告片。

粗糙的手持跟拍:一头熊穿过林子走到路边的房子旁,画面是晃的、树枝是糊的,像有人举着手机跟着跑。10 秒。来源:Black Forest Labs
一台老式显像管终端在自己打字:> initalizing system… > loading kernel modules… OK。10 秒。来源:Black Forest Labs
手绘动画:韦伯太空望远镜在地球和太阳之间飘着,铅笔加水彩的质感,还长了两条卡通小腿。20 秒。来源:Black Forest Labs
这条才是标准的电影感:一匹马在暗底逆光里慢跑,鬃毛被勾出一圈边。15 秒。来源:Black Forest Labs

终端那条片子里有个细节值得记一笔:屏幕上打出来的第一行是 initalizing,少了一个 i。而「画面里的文字准确」正是这次宣传的能力之一。是提示词本来就这么拼,还是模型自己拼错的,材料里没有交代。

接口

三种调用方式:文生视频、图生视频、视频续写

这三种用法其实是同一个接口。所有请求都发到 POST /v1/flux-3-video,请求体长得一模一样,唯一的区别是 mode 字段填什么,而你填的,其实是「我手上有什么」:

t2v 手上只有一句话 i2v 手上有 1–10 张图 v2v 手上有一段旧片子 POST /v1/flux-3-video 同一套请求体 只有 mode 不同 一条带声音的视频
三种模式的分流:输入不同,接口和请求体完全一样。本站绘制

官方文档还做了一件挺聪明的事,拿同一个场景把三种模式串了一遍。先用 t2v 生成一段「她拉着他笑着跑过挂满灯笼的巷子」;再把这条片子的第一帧抠出来喂给 i2v,配一句新的运镜指令,得到同一个开头、完全不同的一条片;最后把整段原片丢给 v2v,让这对人冲出巷子进夜市。后一个请求吃的就是前一个的产物,四条片子层层叠上去,一看就明白三者是什么关系。

一条真实的文生视频请求
curl -X POST https://api.bfl.ai/v1/flux-3-video \
  -H "x-key: $BFL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "mode": "t2v",
    "prompt": "she takes his hand and pulls him laughing
               through the lantern-lit alley, the camera
               chasing them, paper lanterns swaying overhead",
    "duration": 8
  }'

mode 换成 i2vv2v,再多给一个 keyframesstart_video 字段,就是另外两种用法。其余全都可以不填:画幅和时长默认 auto(让模型自己看着办),分辨率默认 hd,声音默认开着。

先看最基础的文生视频。官方挑的这条演示不走温柔路线,一栋房子被装在碰撞试验的滑车上,整个撞进水泥墙里:

文生视频演示:一栋整屋被拖上碰撞试验滑车撞向水泥墙,木料和瓦片炸开。10 秒。来源:Black Forest Labs

再看视频续写。这一路的规矩是:你交一段最长 4 秒的旧片子,再告诉它接下来该发生什么,它把运动、机位、对白和声音一起往后接。官方这条演示把接缝直接标在画面上:前 4 秒是原始素材,第 4 秒往后全是生成的,一条海滨大道的行车记录仪画面,接着接着就冲出来一头驼鹿:

视频续写演示:画面下方时间轴上,0:00–0:04 标着 ORIGINAL CLIP(原片),0:04–0:15 标着 FLUX 3 CONTINUATION(续写)。夕阳、棕榈树、帆船桅杆的光影一路接得住,中途一头驼鹿横穿马路。15 秒。来源:Black Forest Labs
机制

关键帧:最多钉 10 张图,中间由模型补

图生视频这一路的设计和别家不太一样:它没有单独的「首帧」字段。图片全部从 keyframes 这一个字段进去,你给几张、钉在哪一秒,就决定了它是哪种用法。

  • 1 张:这张就是开头。
  • 2 张:一头一尾,中间那段路由它自己走。
  • 最多给 10 张:等于交了一份分镜。
  • 写成 [秒数, 图片] 这样的一对一对:把某张图钉死在第 4 秒。
你钉下的三张图 图 1 图 2 图 3 0 秒 第 4 秒 第 10 秒 钉子之间的每一帧,都由模型自己补出来
关键帧的用法:你负责钉点,它负责补路。本站绘制

官方这条演示自带时间轴,把机制直接演在画面上:三个关键帧钉在 0:00、0:04、0:10,字幕写着 FLUX 3 interpolates the keyframes(FLUX 3 在补关键帧之间的画面)。第三张缩略图里,那艘红色小帆船已经翻了,你只管钉三个点,中间怎么进水、怎么翻,是它编的。

多关键帧演示:一艘红色玩具帆船,画面底部时间轴上三个关键帧缩略图钉在 0:00、0:04、0:10。10 秒。来源:Black Forest Labs

只钉首尾的版本更能看出它自己编了多少:左边 START FRAME 是一间空屋子,右边 END FRAME 是布置好的客厅,中间写着 FLUX 3 fills the in-between(中间由 FLUX 3 填)。家具像折纸一样从地板上展开,这段变形完全没人指定过。

首尾帧演示:空房间到布置完的客厅,中间的家具展开过程由模型生成。竖幅,10 秒。来源:Black Forest Labs
核心

原生音频:声音和画面一起生成,所以口型能对上

为什么以前的 AI 视频,一到人物开口说话就露馅?问题出在做法上,过去是一条三段流水线,一步扣一步:

  • 第一步生成画面。这时候模型手里还没有声音,它并不知道那句台词到底是什么节奏、哪个字重、哪里停顿。
  • 第二步换一个语音模型把台词读出来。这个模型也看不见画面,它只管把字读得像人。
  • 第三步再想办法把嘴唇动作和声音对齐。到这一步已经是打补丁了,能对个大概,对不到每一个音节。

三步之间有两道接缝,每一道都可能错开一点。所以老办法最怕拍近景人脸,嘴型和声音差半拍,观众一眼就出戏。

FLUX 3 的做法

不断。对白、音效、环境音跟每一帧一起生成,是同一次生成里的产物。嘴唇怎么动、声音怎么响,来自同一个模型状态,中间不存在「事后对齐」这一步。

以前:三段流水线,一步扣一步 生成画面 另一个模型配音 再对齐嘴型 两道接缝,每一道都可能错开半拍 FLUX 3:同一次生成,两条轨一起长 一次生成 画面(每一帧) 声音(台词 / 音效 / 环境音)
上:老办法的两道接缝。下:画面轨和声音轨从同一次生成里同时长出来,虚线标的是它们天然对齐的时刻。本站绘制

接口这一层也是按「默认要声音」设计的:generate_audio 不填就是 true,你拿到的就是有声视频,不需要额外开关。

语言这块点名了十三种:英语(多种口音)、中文、西班牙语、法语、德语、日语、葡萄牙语、俄语、意大利语、印尼语、土耳其语、印地语、旁遮普语,名单后面还跟了个「等等」。韩语不在这份点名名单里,「等等」里覆盖到什么程度,材料里没写。

对白的演示是两个穿西装的男人隔着一张桌子、对着两支老式麦克风争辩,像上世纪的电视辩论现场,整整 20 秒不断:

对白与音效演示:两人对着老式麦克风一来一往,20 秒。来源:Black Forest Labs

多语言那条更值得看的其实是另一件事:同一个穿红色雨衣的女生,连着出现在餐厅卡座、夜市小吃摊、自助洗衣店三个场景里说话,同一张脸跨三个镜头没走样。

多语言演示:红雨衣角色在三个场景里连续开口,人物长相在换场后保持一致。18.8 秒。来源:Black Forest Labs
能力

多镜头切换,以及它认识的真实地点

一条 20 秒的片子里,一只黑猫从卧室的床上跳到沙发,然后镜头直接切到屋外,从街上回看这栋房子的窗户,猫还在窗里,接着再切到花园和灌木丛。镜头是真的换了机位、剪了几刀,前后还接得上,而不只是同一个画面里的推拉摇移。以前要这种效果,得分几段生成再自己剪:

多镜头演示:黑猫夜行,室内跳跃到室外远景再到花园,一次生成里完成几次机位切换。20 秒。来源:Black Forest Labs

另一条演示对应的能力叫「世界知识 + 实时接地」,卖点是几个词的提示词就能拍纪录片和科普短片。画面看着像德国弗莱堡老城:街边那条窄窄的引水沟(当地叫 Bächle)、红砂岩的哥特式大教堂、一对挂着相机的游客,整条片是八九十年代旅游录像带的味道。片子里没有标地点,不过弗莱堡正是 BFL 自己的总部所在,公司名里的「黑森林」就是那一片山区。

世界知识演示:老城步行街、引水沟与红砂岩教堂,画面质感做成了旧录像带。20 秒。来源:Black Forest Labs
核心

草稿模式:三分之一价格,选中后原样重渲

视频生成有个磨人的地方,试过的人都懂:你写一句提示词,抽到一条还不错的,想再要一条「差不多但更好一点」的,重新提交就是一次全新的生成。主体、构图、运动全都可能变,你刚才喜欢的那条,可能再也抽不出来了。而每抽一次都在烧钱。

草稿模式把这件事拆成两步:

第一步:便宜地多抽几条(1 倍时间、1/3 价钱) 草稿 $0.06/秒 草稿 $0.06/秒 ✓ 你选中这条 $0.06/秒 草稿 $0.06/秒 draft_cache 第二步:把这个包发回去,模式填 draft_enhance 同一次生成,用全画质重渲一遍(1.8 倍时间) 同一个镜头、同一个种子,什么都不重新解释
草稿模式的两步。1 倍时间、1/3 价钱、1.8 倍时间这三个数字直接标在官方对比视频的画面上。本站绘制

第一步,请求里加 draft: true,拿回一条快速预览。草稿是 1 倍时间、1/3 价钱,全画质要 1.8 倍时间,这三个数字直接印在对比视频的画面上。便宜到你可以放开了多抽几条。

第二步,挑中一条之后,这条草稿的结果里会附一个 draft_cache 包。把它下载下来,模式填 draft_enhance 再发回去,模型就把同一次生成用全画质重渲一遍。

「同一个镜头、同一个种子,什么都不重新解释。」

Black Forest Labs 开发者文档(本站译)
打个比方

普通的重新生成像重新抽一次卡,抽到什么算什么;draft_cache 相当于给这次抽卡留了个存档点,你要的那条不用再抽,直接读档,然后按最高画质重新渲染一遍。

所以草稿模式卖的不只是打折,它把探索和交付拆成两笔钱:探索按三分之一价随便抽,只有你点头的那一条付全价,而且付全价拿到的,确实是你点头的那一条。

草稿与全画质对照:同一句提示词(登山者在晨雾里登顶),左边标 Draft「1X TIME, 1/3 COST」,右边标 Normal「1.8X TIME」。10 秒。来源:Black Forest Labs
价格

价格表:视频续写每秒 $0.43,是从头生成的 2.5 倍

三种模式的完整价目,全在文档里:

模式你给它什么时长全画质草稿
文生视频一句提示词5–20 秒$0.17/秒(hd)
$0.29/秒(fhd)
$0.06/秒
图生视频提示词 + 1–10 张图5–20 秒$0.17/秒(hd)
$0.29/秒(fhd)
$0.06/秒
视频续写提示词 + 你的片子5–15 秒$0.43/秒(hd)
$0.54/秒(fhd)
$0.12/秒

三件事直接从表里读得出来:

  • 视频续写贵一大截。同样是高清,续写每秒 $0.43,是从头生成 $0.17 的 2.5 倍还多。一条 10 秒的片子,从头生成 1.7 美元,续写要 4.3 美元。为什么贵,文档里没有解释。
  • 视频续写还更短。另外两种最长 20 秒,续写封顶 15 秒,少了整整 5 秒。
  • 草稿一律按 hd 渲染,没有 fhd 的草稿。
文生 / 图生视频(hd)
$0.17/秒
文生 / 图生视频(fhd)
$0.29/秒
视频续写(hd)
$0.43/秒
草稿(任意模式)
$0.06/秒
每秒单价,按同一比例。本站根据官方价目表绘制

换算成一笔具体的账。一条 10 秒的高清文生视频:

  • 直接出全画质:1.7 美元,但你只有一条,不满意就得重抽。
  • 盲抽 3 条全画质挑一条:5.1 美元
  • 先抽 3 条草稿,挑中一条再重渲:3 × 0.6 + 1.7 = 3.5 美元,而且定稿的就是你挑的那条。

还有一条容易踩的:生成结果的下载链接是签名的,大约 2 小时后过期。跑完要及时把片子取走,别等到第二天。

数据

跑分:文生视频第一,图生视频与 Seedance 2.0 打平

官方放了一张人评 ELO 榜,两两对打算分。两边的完整排名都在图上:

FLUX 3 在文生视频与图生视频两项人评 ELO 榜上的排名
文生视频(左):FLUX 3 T2V 1135、Gemini Omni Flash 1090、Minimax H3 1082、Seedance 2.0 1069、Kling v3 Pro 1054……图生视频(右):FLUX 3 I2V 1051、Seedance 2.0 1049、Minimax H3 1039、Grok Imagine v1.5 1023、Gemini Omni Flash 1022……来源:Black Forest Labs

两边的差距完全不是一回事:

文生视频 FLUX 3 T2V 1135 Gemini Omni Flash 1090 领先 45 分 图生视频 FLUX 3 I2V 1051 Seedance 2.0 1049 领先 2 分
两条差距条按同一比例画,1 分 = 2 像素。本站根据官方 ELO 榜数据绘制

文生视频领先第二名 45 分,是有分量的差距。图生视频那边只高出 2 分,官方自己在正文里用的词也是「打平(ties)Seedance 2.0」,没有写赢。

还有两处值得对着榜单看一眼:

  • 文生视频那张榜里没有 Veo 3.1。它出现在图生视频榜的第 8 名(975 分),文生视频那边的十个名额里找不到它,材料里没有说明原因。
  • 被拿来比的是 Seedance 2.0。字节在 7 月 31 日已经发过 Seedance 2.5,这张榜没有把它算进来。
站内相关
字节跳动发布 Seedance 2.5:单次 30 秒直出,一条指令能同时指挥 50 个参考素材
榜上那个 Seedance 2.0 的下一代,比这次 FLUX 3 Video 早四天发布。

这张榜的前提要说清楚:评测由 BFL 自己组织,评的也是自己家的模型排第一,不是第三方榜单。上面那些演示片子都是原样嵌的,可以自己看着判断。

边界

还没上线的功能,和几条限制

文档第一屏就写着,FLUX 3 现在是 preview(预览)状态。已经标出来「即将推出」的有两项:视频编辑,以及 Omni Reference,拿图片和视频当参考素材来控制生成。

路线图再往后是 FLUX 3 Image(图像生成和编辑)和 FLUX 3 Dev(开放权重版本)。开放权重仍然排在最后一位,跟 7 月那次公告的顺序一致。发布推文里另外提到 2K 和 4K 也在路上。

安全这块的做法:发布前找了第三方机构 Cinder 做评估,覆盖非自愿私密影像(NCII)和儿童性虐待材料(CSAM)等风险。接口上有个 safety_tolerance 参数,0 到 4,默认 2,0 最严。有三条硬上限写在文档里,不受你填什么影响:

  • 性相关内容最高只到 3 级
  • 仇恨内容最高只到 2 级
  • 只要请求里带了参考图或参考视频,一律压到 2 级

这次发布页的标题是「FLUX 3 Video, Part 1: Generation」(第一部分:生成)。整篇没有架构、训练方法或技术报告,能查到的只有能力和接口,所以模型内部怎么做到音画同生,目前还没有可核对的材料。

🧰 上手卡 · FLUX 3 Video
价格草稿 $0.06/秒;全画质 $0.17(hd)/ $0.29(fhd)每秒;视频续写 $0.43 每秒起
门槛注册 BFL 账号充值后拿 API key,POST 到 /v1/flux-3-video;不想写代码可以先在官网 Playground 里试
来源
FLUX 3 Video, Part 1: GenerationBlack Forest Labs·官方发布页·2026-08-04
本站说明
十三条演示视频与 ELO 跑分图取自官方发布页,开篇那条 60 秒发布片取自官方发布推文;本站逐条播放核对过画面内容、画面内文字与来源标注,每条视频的时长、分辨率、帧率用 ffprobe 实测。价格、参数、模式定义取自开发者文档与 API 参考。文中四张示意图(模式分流、关键帧时间轴、音画对比、草稿两步)与价格条、ELO 差距图为本站绘制。弗莱堡的地点判断依据是画面里的引水沟与红砂岩教堂,原页未标注地点。