产品发布 · 小互解读

字节跳动发布 SeedRealtime 边看边聊模型:对标 GPT Live,跟豆包可以进行实时语音视频聊天

边看、边听、边说同时进行,不再外挂一个只听静音的小模块;已在豆包 App 全量上线,免费
一分钟速览
  • 举着手机开着摄像头跟 AI 聊,它不用等你说完就能接话,今天在豆包 App 免费开放,更新一下就能用。
  • 能看摄像头的 AI 早就有了。但判断「你说完没有」的,一直是一个只听声音、看不见画面的小模块。
  • 官方一口气放了 7 段实拍:认人辨声、逛博物馆替你盯展品、机场吵成一团时不被旁人闲聊带偏。
材料来自字节跳动 Seed 的官方项目页与官方公众号,7 段演示视频均由官方拍摄提供。「节奏问题减少一半」是其端到端人工评测的自评口径,评测规模与方法未公开,也没有第三方复现。文中对 OpenAI、Google 现状的核对来自两家的公开说明与技术文档,已在正文标注。
发布

SeedRealtime 是什么,今天在哪能用上

字节跳动 Seed 团队今天发布了原生音视频全双工(full-duplex,同一时间既能听也能说)大模型 SeedRealtime,你举着手机开着摄像头跟它说话,它能一边看你眼前的东西、一边听你讲、一边开口回应,三件事同时干。最实在的一点是:它今天就在豆包 App 全量上线,免费,更新到最新版点「打电话」就能用,不用申请内测。

新在哪?一句话说清:过去的「边听边说」只管声音,字节自己 4 月发的 Seeduplex 是纯语音,OpenAI 7 月 8 日发的 GPT-Live 也是纯语音。这次把画面塞进了同一个模型,而关键在于,「现在该不该开口」这个判断,是看着画面、听着声音一起做出来的。随发布放出的 7 段一到三分钟实拍,下面会逐段过一遍。

旧路

以前让 AI 边看边聊的三种做法,各差在哪

要判断这次的动作值不值钱,得先知道让 AI「边看边聊」此前有三条路,每条都卡在一处。

第一条,接力传话。语音转文字、看图模型看画面、大模型想答案、文字转语音说出来,四个模块排成一队,一步做完才轮到下一步。延迟一层层叠加不说,你说话时的语气、语速、犹豫,在「转成文字」那一步就被磨没了,后面的模型只看到一行干巴巴的字。这套架构的正式叫法是级联系统,你可以当成一场接力赛:每交接一次棒,就掉一点东西。

第一代 · 接力传话 四个模块排成一队 转文字 看画面 想答案 转语音 每步都得等 上一步做完 延迟一层层叠加;你的语气和停顿,在「转文字」那步就没了 第二代 · 端到端 一个模型直接收发 一个模型:边听边说 画面 耳朵有了, 眼睛还没有
前两代做法示意(本站绘制)。接力传话的正式叫法是级联系统,四个模块串成一队;第二代把它们合成一个模型,快了顺了,但只处理声音。

第二条,一个模型直接收音频、直接吐音频,中间不转文字,这就是所谓的端到端。快了也顺了,但它只有耳朵没有眼睛。OpenAI 7 月发的 GPT-Live、字节自己 4 月发的 Seeduplex,都在这一档。

站内 · 声音这条线上,把小模块删掉是怎么做到的
OpenAI 复盘:我们是如何在 6 个月内完成构建 GPT-Live 实时语音系统的
同一个思路在纯语音上的完整工程账,从删掉回合检测器一路讲到重做连接握手。

第三条路最容易被误会成已经解决了

第三条,能看摄像头,但判断你说完没有的,还是一个只听声音的小模块。这个小模块叫 VAD(voice activity detection,语音活动检测),职责单一到有点可怜,只判断「现在有没有人在出声」。它靠静音来猜你说完没有:猜早了,你话说到一半被打断;猜晚了,你说完半天它还愣着。

以 Google 的实时语音产品 Gemini Live 为例。它确实能接摄像头和屏幕共享,但 LiveKit 的官方接入文档把这一点写明了:Gemini Live API 的轮次检测是「内置的、基于 VAD 的」(built-in VAD-based turn detection),默认就开着。同一份文档还写了取帧节奏,你说话时每秒抽 1 帧画面,你不说话时每 3 秒才抽 1 帧。

取帧那个数是 LiveKit 这套框架的默认值,不是 Gemini 本身的能力上限,可以自己调。但轮次检测靠 VAD 那一条,说的是 Gemini Live API 本身。

要害
画面确实喂进去了,但它不参与「该不该现在说话」这个决策。决策还是那个只听声音的小模块在做。所以你举着手机拍东西,模型理解画面归理解画面,什么时候开口是另一套逻辑在管。
声音(麦克风) 画面(摄像头) 说什么 , 模型负责 画面和声音都进来了 什么时候开口 , VAD 负责 只有声音进来 画面进不到这一步 理解画面归理解画面,什么时候开口是另一套逻辑在管 , 断点就在这里
示意图(本站绘制):能看摄像头的做法里,画面进得了「说什么」,进不了「什么时候说」。
机制

这次的改动:判断该不该开口时,让画面也参与

SeedRealtime 的动作只有一个:把声音、画面、时序、表达统一进同一个端到端模型。它不再走「先听完、再看完、最后作答」那一套。在连续的音视频流上,它边看边听边算,每一刻都在判断:现在该说话、该接着看、还是该闭嘴。

那个外挂的 VAD 因此没有存在的必要了。轮次判断从一条外部规则,变成了模型自己每时每刻在做的内部决定,而这个决定,看得到画面。

旧办法 声音 判断 你停了一下 只在你停下来的那一刻,判断一次:他说完了吗? SeedRealtime 画面和声音一起流过来,判断一刻不停 画面 声音 判断 每一刻都在判断:该开口、该接着看、还是该闭嘴
示意图(本站绘制):旧办法要等一个停顿才判断一次;统一进一个模型之后,判断变成连续的,而且画面也在里面。
打个比方

旧办法像考试时举手:你得先停笔、举手,监考老师看见了才走过来。新办法像身边坐着个人:他一直看着你的卷子、听着你嘀咕,你笔尖一顿他就知道该不该开口。

工程上官方提了两句(只在官网项目页里有,公众号版没写):通过连续音视频分块输入与流式生成输出缩短响应时间,再靠高效量化与推理优化提升服务效率。具体的延迟数字没给。

难点

两个难点:视频没有停顿可以借,用户说的「这个」指哪个

把决策交给模型这句话说着简单,真做起来卡在两处。这两处是官方自己点出来的。

难点一:视频没有停顿可以借

语音天然带停顿,可以拿停顿当「你说完了」的信号。视频不一样,它始终在线、持续变化,没有天然的分界点。模型既要不断理解画面里正在发生什么,又不能因为背景有人说话就频繁插嘴,还得持续判断该关注哪个对象、该听谁说话,以及此刻到底该不该回应。

难点二:你说的「这个」,指的是哪个

你说「这个怎么弄」的时候,「这个」指的是啥?模型得结合当前画面、你的手势、你的视线,还有你前几秒做过的动作,才能对上。碰到同音词或者含糊的发音,也得靠眼前的场景来消歧,画面里是川菜馆,那「鱼香」就不会被听成别的意思。

用户说: 「这个」怎么弄? 光听这句,对不上 画面里正对着的东西 你手指的方向 你前几秒做过的动作 对齐 「这个」= 手柄上那个旋钮
示意图(本站绘制):「这个怎么弄」这句引自官方对难点的描述,右侧的具体答案是本站按第四段咖啡机演示补的示意,不是原文原话。

只有把声音、画面和时序信息统一建模,模型才能真正把所见、所闻和所说对应起来。这也是为什么「把画面接进决策」不能靠给旧系统外挂一个视觉模块了事。

演示

七段官方实拍演示

官方一口气放了 7 段完整实拍,每段一到三分钟,按三组能力分。先看它在手机上长什么样,通话界面上一直标着它此刻是在说、还是在听:

豆包 App 视频通话界面,标着「说话中」
左上角标着「说话中…」。来源:字节跳动 Seed
豆包 App 视频通话界面,标着「倾听中」
这一刻标着「倾听中…」。来源:字节跳动 Seed

第一组:认得出画面里是谁,分得清谁在说话

四人聚餐场景。用户逐一介绍在场的人,模型把名字和人对上,之后在七嘴八舌的讨论里始终分得清谁是谁。来源:字节跳动 Seed

四位好友聚餐,人多话杂。用户逐一介绍在场的人,模型靠外形特征把名字和人对上,浅色头发的七七、戴眼镜的 Julia,还主动跟乐乐打了招呼。之后大家聊起旅行:有人想去海边拍照逛海洋馆,有人怕热怕累,有人对海鲜过敏。它能分清每句话是谁说的,最后给出一份兼顾所有人需求的旅行方案。认人、辨声、听懂各自的需求,一个模型在同一场对话里实时干完。

川菜馆场景。模型从画面里认出菜品、用英语向外籍食客推荐,并解释菜名背后的文化背景。来源:字节跳动 Seed

川菜馆里,外籍食客对着中文菜单发懵。模型直接从画面里认出菜品、用英语推荐,还顺着文化背景解释「为什么鱼香肉丝里没有鱼」「皮蛋是怎么做的」。服务员上菜时随口说了句「很下饭」,它结合画面里的菜理解了这句话,翻译给客人听。视觉信息不用先转成文字再理解,眼前有什么,就能答什么。

第二组:不用你开口问,它自己看着办

河北博物院场景。用户交代一句「看到错金银铜虎噬鹿屏座就提醒我」,镜头扫过那件展品时模型出声提醒。来源:字节跳动 Seed

在河北博物院逛展,用户交代一句「看到错金银铜虎噬鹿屏座就提醒我」,然后就自己逛。镜头一路移动,扫过那件展品时它出声提醒。之后还结合画面细节讲解错金银四龙四凤铜方案座、长信宫灯,以及铸造、错金银、焊接这些工艺。这一段演的是把任务记在上下文里,目标出现就自己开口。

咖啡机场景。用户把整粒咖啡豆倒进萃取手柄,模型看见后立刻纠正;萃取结束又根据油脂成色给出调整建议。来源:字节跳动 Seed

用户把整粒咖啡豆直接倒进萃取手柄,模型看见了立刻纠正,「豆子不能直接倒进去,得先磨成细粉」。萃取完,它看杯里油脂的成色和液量,主动建议「下次萃取时间缩短 2-3 秒」。全程用户没提问,它自己看着办。

研读 ResNet 论文。模型结合结构图讲跳接,并在快速翻页中认出「3.4 Implementation」段落主动叫停。来源:字节跳动 Seed

研读 ResNet 论文时,模型先结合网络结构图讲清跳接怎么缓解梯度消失;然后用户说「帮我盯着,翻到训练参数那部分提醒我」,它就在快速翻页的过程中持续盯着画面,认出「3.4 Implementation」那一段主动叫停,随即报出学习率、动量、权重衰减这些配置。

第三组:吵成一团时,它知道该听谁的

大兴机场场景。同伴闲聊时提到「老李的航班」没有触发回复;用户正式问起时,它结合此前看到的大屏信息作答并联网补充。来源:字节跳动 Seed

大兴机场人流密集、环境嘈杂。同伴闲聊时随口提了句「老李的航班」,模型没被这句无关的话触发回复;等用户正式问起,即便航班信息已经从画面里移出去了,它仍能结合刚才看到的大屏信息回答实时到达时间,还联网给出行李转盘位置。之后二人边走边聊往事,它扫到网约车指示牌时自然接话,给出上车点路线。

陪孩子学英文场景。背景里有人在打电话,模型没有被无关人声带偏,始终跟着孩子手指的方向纠音、造句。来源:字节跳动 Seed

妈妈在一旁忙别的事,让它陪女儿学动物英文。背景里爸爸正在接电话、人声不断,它没被带偏,始终跟着女孩手指的方向实时纠音、举例造句。

串起来看
这三组其实是同一件事的三个侧面。因为画面参与了决策,它才能主动提醒(看到目标就出声)、才能不被带偏(看得出谁在跟自己说话)、才能解开「这个」指的是哪个。
数据

官方给的数据:对话卡壳比老办法少一半

演示看着漂亮,但量化结论只有一条:端到端人工评测显示,相比接力传话的级联模型,音视频对话的节奏问题减少了一半。这里的「节奏问题」指三类卡壳,话没说完被抢断、话音落了半天没回应、被背景杂音和旁人闲聊误触发。

音视频对话里的节奏问题(抢断 / 迟缓 / 误触发)
级联模型
基准
SeedRealtime
少一半
口径:端到端人工评测,厂商自评。评测员人数、对话样本量、「节奏问题」的量化定义、被对比的级联模型具体是哪一个,均未公开。

另有一句「单次对话能够完整、顺畅交流的概率也有明显提升」,没给数字。

没给的东西值得单列一下:延迟是多少毫秒(实时交互里最硬的指标)、模型多大、任何公开跑分、第三方复现,一样都没有。展望里还写着未来要「持续压缩听到—理解—回应的端到端时延」,等于承认现在还有压缩空间,但眼下的基线是多少不讲。

作为参照,上一代纯语音的 Seeduplex 今年 4 月发布时数字给得细一些:误回复率和误打断率减少一半、抢话比例相对下降 40%、判停表现提升 8%,大规模 A/B 实验里整体通话满意度绝对值提升 8.34%。同一个团队,四个月前那份披露的颗粒度明显更细。

位置

字节这条线怎么走到今天,OpenAI 和 Google 现在做到哪一步

把它放回时间线上,这次的位置才看得清。字节这条线走了四步:

此前豆包 Realtime Voice半双工:你说完,它才开口2026-04-09Seeduplex , 声音能边听边说了豆包 App 全量上线,官网称为上亿用户提供2026-06-18火山引擎开放 API(豆包实时语音模型 3.0)从自家 App 走到开发者手里2026-08-05SeedRealtime , 画面也进来了什么时候开口,第一次看着画面决定 画面在这一步并进来
字节这条线的四个节点。前三步只关声音,第四步把画面并了进来。

同期另外两家在哪:OpenAI 7 月 8 日发布的 GPT-Live 是全双工,但在 ChatGPT 里还不支持摄像头和共享屏幕,官方的说法是「稍后」支持。Google 的 Gemini Live 早就能看摄像头和屏幕,轮次判断如前所述是内置 VAD。

方案能不能看画面什么时候开口,谁说了算上线状态
SeedRealtime
字节跳动
能,画面连续进模型模型自己,边看边听边判断豆包 App 全量,免费
GPT-Live
OpenAI
在 ChatGPT 里还不能,官方称稍后支持模型自己(全双工),但只听得到声音全球 ChatGPT 上线
Gemini Live
Google
能,摄像头和屏幕共享都行内置 VAD,默认开启已上线

所以字节那句「在业界率先实现了音视频全双工技术的规模化落地」,按这两家逐个核下来能对上:能看画面的那家,轮次还交给 VAD;全双工做得最彻底的那家,还没接上摄像头。这个核查有边界,只核了 OpenAI 和 Google 两家的公开状态,国内其余几家没有逐个查。

站内 · 表里那一行 GPT-Live 是什么
OpenAI 发布 GPT-Live:和 AI 说话不用轮流开口,难问题自动找 GPT-5.5
同一件事在纯语音上做到什么程度,那篇讲的是产品层面能干什么。
上手

怎么用:豆包 App 更新后点「打电话」

入口很短:豆包 App 更新到最新版,在对话框里点「打电话」,进视频通话界面就是它。免费,不用申请。目前公布的入口只有这一个,没有 API 或者开发者接入的消息,作为参照,上一代 Seeduplex 是 4 月 9 日在豆包 App 全量上线、6 月 18 日才在火山引擎开放 API 的。

🧰 上手卡 · SeedRealtime(豆包 App 视频通话)
价格免费(豆包 App 内)
门槛豆包 App 更新到最新版,对话框内选「打电话」进视频通话界面即可,无需申请
来源
SeedRealtime字节跳动 Seed·项目主页·2026-08-05
本站说明
7 段演示视频与两张产品截图均来自字节跳动 Seed 官方发布,已转存本站。文中全部机制示意图为本站绘制。Seeduplex 的数据出自其 2026-04-09 发布口径;GPT-Live 的摄像头支持状态出自 OpenAI 公开说明;Gemini Live 的轮次检测与取帧节奏出自 LiveKit 官方接入文档,这三项都不出自字节这次的发布材料。