字节跳动发布 SeedRealtime 边看边聊模型:对标 GPT Live,跟豆包可以进行实时语音视频聊天
- 举着手机开着摄像头跟 AI 聊,它不用等你说完就能接话,今天在豆包 App 免费开放,更新一下就能用。
- 能看摄像头的 AI 早就有了。但判断「你说完没有」的,一直是一个只听声音、看不见画面的小模块。
- 官方一口气放了 7 段实拍:认人辨声、逛博物馆替你盯展品、机场吵成一团时不被旁人闲聊带偏。
SeedRealtime 是什么,今天在哪能用上
字节跳动 Seed 团队今天发布了原生音视频全双工(full-duplex,同一时间既能听也能说)大模型 SeedRealtime,你举着手机开着摄像头跟它说话,它能一边看你眼前的东西、一边听你讲、一边开口回应,三件事同时干。最实在的一点是:它今天就在豆包 App 全量上线,免费,更新到最新版点「打电话」就能用,不用申请内测。
新在哪?一句话说清:过去的「边听边说」只管声音,字节自己 4 月发的 Seeduplex 是纯语音,OpenAI 7 月 8 日发的 GPT-Live 也是纯语音。这次把画面塞进了同一个模型,而关键在于,「现在该不该开口」这个判断,是看着画面、听着声音一起做出来的。随发布放出的 7 段一到三分钟实拍,下面会逐段过一遍。
以前让 AI 边看边聊的三种做法,各差在哪
要判断这次的动作值不值钱,得先知道让 AI「边看边聊」此前有三条路,每条都卡在一处。
第一条,接力传话。语音转文字、看图模型看画面、大模型想答案、文字转语音说出来,四个模块排成一队,一步做完才轮到下一步。延迟一层层叠加不说,你说话时的语气、语速、犹豫,在「转成文字」那一步就被磨没了,后面的模型只看到一行干巴巴的字。这套架构的正式叫法是级联系统,你可以当成一场接力赛:每交接一次棒,就掉一点东西。
第二条,一个模型直接收音频、直接吐音频,中间不转文字,这就是所谓的端到端。快了也顺了,但它只有耳朵没有眼睛。OpenAI 7 月发的 GPT-Live、字节自己 4 月发的 Seeduplex,都在这一档。
第三条路最容易被误会成已经解决了
第三条,能看摄像头,但判断你说完没有的,还是一个只听声音的小模块。这个小模块叫 VAD(voice activity detection,语音活动检测),职责单一到有点可怜,只判断「现在有没有人在出声」。它靠静音来猜你说完没有:猜早了,你话说到一半被打断;猜晚了,你说完半天它还愣着。
以 Google 的实时语音产品 Gemini Live 为例。它确实能接摄像头和屏幕共享,但 LiveKit 的官方接入文档把这一点写明了:Gemini Live API 的轮次检测是「内置的、基于 VAD 的」(built-in VAD-based turn detection),默认就开着。同一份文档还写了取帧节奏,你说话时每秒抽 1 帧画面,你不说话时每 3 秒才抽 1 帧。
取帧那个数是 LiveKit 这套框架的默认值,不是 Gemini 本身的能力上限,可以自己调。但轮次检测靠 VAD 那一条,说的是 Gemini Live API 本身。
画面确实喂进去了,但它不参与「该不该现在说话」这个决策。决策还是那个只听声音的小模块在做。所以你举着手机拍东西,模型理解画面归理解画面,什么时候开口是另一套逻辑在管。
这次的改动:判断该不该开口时,让画面也参与
SeedRealtime 的动作只有一个:把声音、画面、时序、表达统一进同一个端到端模型。它不再走「先听完、再看完、最后作答」那一套。在连续的音视频流上,它边看边听边算,每一刻都在判断:现在该说话、该接着看、还是该闭嘴。
那个外挂的 VAD 因此没有存在的必要了。轮次判断从一条外部规则,变成了模型自己每时每刻在做的内部决定,而这个决定,看得到画面。
旧办法像考试时举手:你得先停笔、举手,监考老师看见了才走过来。新办法像身边坐着个人:他一直看着你的卷子、听着你嘀咕,你笔尖一顿他就知道该不该开口。
工程上官方提了两句(只在官网项目页里有,公众号版没写):通过连续音视频分块输入与流式生成输出缩短响应时间,再靠高效量化与推理优化提升服务效率。具体的延迟数字没给。
两个难点:视频没有停顿可以借,用户说的「这个」指哪个
把决策交给模型这句话说着简单,真做起来卡在两处。这两处是官方自己点出来的。
难点一:视频没有停顿可以借
语音天然带停顿,可以拿停顿当「你说完了」的信号。视频不一样,它始终在线、持续变化,没有天然的分界点。模型既要不断理解画面里正在发生什么,又不能因为背景有人说话就频繁插嘴,还得持续判断该关注哪个对象、该听谁说话,以及此刻到底该不该回应。
难点二:你说的「这个」,指的是哪个
你说「这个怎么弄」的时候,「这个」指的是啥?模型得结合当前画面、你的手势、你的视线,还有你前几秒做过的动作,才能对上。碰到同音词或者含糊的发音,也得靠眼前的场景来消歧,画面里是川菜馆,那「鱼香」就不会被听成别的意思。
只有把声音、画面和时序信息统一建模,模型才能真正把所见、所闻和所说对应起来。这也是为什么「把画面接进决策」不能靠给旧系统外挂一个视觉模块了事。
七段官方实拍演示
官方一口气放了 7 段完整实拍,每段一到三分钟,按三组能力分。先看它在手机上长什么样,通话界面上一直标着它此刻是在说、还是在听:


第一组:认得出画面里是谁,分得清谁在说话
四位好友聚餐,人多话杂。用户逐一介绍在场的人,模型靠外形特征把名字和人对上,浅色头发的七七、戴眼镜的 Julia,还主动跟乐乐打了招呼。之后大家聊起旅行:有人想去海边拍照逛海洋馆,有人怕热怕累,有人对海鲜过敏。它能分清每句话是谁说的,最后给出一份兼顾所有人需求的旅行方案。认人、辨声、听懂各自的需求,一个模型在同一场对话里实时干完。
川菜馆里,外籍食客对着中文菜单发懵。模型直接从画面里认出菜品、用英语推荐,还顺着文化背景解释「为什么鱼香肉丝里没有鱼」「皮蛋是怎么做的」。服务员上菜时随口说了句「很下饭」,它结合画面里的菜理解了这句话,翻译给客人听。视觉信息不用先转成文字再理解,眼前有什么,就能答什么。
第二组:不用你开口问,它自己看着办
在河北博物院逛展,用户交代一句「看到错金银铜虎噬鹿屏座就提醒我」,然后就自己逛。镜头一路移动,扫过那件展品时它出声提醒。之后还结合画面细节讲解错金银四龙四凤铜方案座、长信宫灯,以及铸造、错金银、焊接这些工艺。这一段演的是把任务记在上下文里,目标出现就自己开口。
用户把整粒咖啡豆直接倒进萃取手柄,模型看见了立刻纠正,「豆子不能直接倒进去,得先磨成细粉」。萃取完,它看杯里油脂的成色和液量,主动建议「下次萃取时间缩短 2-3 秒」。全程用户没提问,它自己看着办。
研读 ResNet 论文时,模型先结合网络结构图讲清跳接怎么缓解梯度消失;然后用户说「帮我盯着,翻到训练参数那部分提醒我」,它就在快速翻页的过程中持续盯着画面,认出「3.4 Implementation」那一段主动叫停,随即报出学习率、动量、权重衰减这些配置。
第三组:吵成一团时,它知道该听谁的
大兴机场人流密集、环境嘈杂。同伴闲聊时随口提了句「老李的航班」,模型没被这句无关的话触发回复;等用户正式问起,即便航班信息已经从画面里移出去了,它仍能结合刚才看到的大屏信息回答实时到达时间,还联网给出行李转盘位置。之后二人边走边聊往事,它扫到网约车指示牌时自然接话,给出上车点路线。
妈妈在一旁忙别的事,让它陪女儿学动物英文。背景里爸爸正在接电话、人声不断,它没被带偏,始终跟着女孩手指的方向实时纠音、举例造句。
这三组其实是同一件事的三个侧面。因为画面参与了决策,它才能主动提醒(看到目标就出声)、才能不被带偏(看得出谁在跟自己说话)、才能解开「这个」指的是哪个。
官方给的数据:对话卡壳比老办法少一半
演示看着漂亮,但量化结论只有一条:端到端人工评测显示,相比接力传话的级联模型,音视频对话的节奏问题减少了一半。这里的「节奏问题」指三类卡壳,话没说完被抢断、话音落了半天没回应、被背景杂音和旁人闲聊误触发。
另有一句「单次对话能够完整、顺畅交流的概率也有明显提升」,没给数字。
没给的东西值得单列一下:延迟是多少毫秒(实时交互里最硬的指标)、模型多大、任何公开跑分、第三方复现,一样都没有。展望里还写着未来要「持续压缩听到—理解—回应的端到端时延」,等于承认现在还有压缩空间,但眼下的基线是多少不讲。
作为参照,上一代纯语音的 Seeduplex 今年 4 月发布时数字给得细一些:误回复率和误打断率减少一半、抢话比例相对下降 40%、判停表现提升 8%,大规模 A/B 实验里整体通话满意度绝对值提升 8.34%。同一个团队,四个月前那份披露的颗粒度明显更细。
字节这条线怎么走到今天,OpenAI 和 Google 现在做到哪一步
把它放回时间线上,这次的位置才看得清。字节这条线走了四步:
同期另外两家在哪:OpenAI 7 月 8 日发布的 GPT-Live 是全双工,但在 ChatGPT 里还不支持摄像头和共享屏幕,官方的说法是「稍后」支持。Google 的 Gemini Live 早就能看摄像头和屏幕,轮次判断如前所述是内置 VAD。
| 方案 | 能不能看画面 | 什么时候开口,谁说了算 | 上线状态 |
|---|---|---|---|
| SeedRealtime 字节跳动 | 能,画面连续进模型 | 模型自己,边看边听边判断 | 豆包 App 全量,免费 |
| GPT-Live OpenAI | 在 ChatGPT 里还不能,官方称稍后支持 | 模型自己(全双工),但只听得到声音 | 全球 ChatGPT 上线 |
| Gemini Live | 能,摄像头和屏幕共享都行 | 内置 VAD,默认开启 | 已上线 |
所以字节那句「在业界率先实现了音视频全双工技术的规模化落地」,按这两家逐个核下来能对上:能看画面的那家,轮次还交给 VAD;全双工做得最彻底的那家,还没接上摄像头。这个核查有边界,只核了 OpenAI 和 Google 两家的公开状态,国内其余几家没有逐个查。
怎么用:豆包 App 更新后点「打电话」
入口很短:豆包 App 更新到最新版,在对话框里点「打电话」,进视频通话界面就是它。免费,不用申请。目前公布的入口只有这一个,没有 API 或者开发者接入的消息,作为参照,上一代 Seeduplex 是 4 月 9 日在豆包 App 全量上线、6 月 18 日才在火山引擎开放 API 的。
决定 AI 什么时候开口的,第一次是一个看得见画面的模型
字节跳动 Seed 发布 SeedRealtime,把边看、边听、边说合进同一个模型,今天在豆包 App 免费开放,一页带图讲完
↓ 一页读完 · 有一张会动的图
你举着手机开着摄像头跟它说话,它一边看你眼前的东西、一边听你讲、一边开口回应,三件事同时干(业内叫全双工,同一时间既能听也能说)。这是字节跳动 Seed 今天发布的 SeedRealtime,已经在豆包 App 全量上线。
豆包 App 更新到最新版,对话框点「打电话」进视频通话界面,免费,不用申请内测
认得出画面里的人,分得清七嘴八舌时是谁在说话
你交代一句「看到某样东西提醒我」,它自己盯着,目标出现就出声
入口只有豆包 App 这一个,没有 API 或者开发者接入的消息
没公布端到端延迟是多少毫秒,实时交互里这是最硬的指标
让 AI 边看边聊,此前有三条路。前两条的毛病好懂,第三条最容易被当成已经解决了:摄像头是接上了,可判断「你说完没有」的还是 VAD(语音活动检测,一个只听此刻有没有人出声的小模块),它靠静音来猜,猜早了打断你,猜晚了你说完半天它还愣着。
字节说的「在业界率先实现音视频全双工技术的规模化落地」,按这两家逐个核下来能对上:能看画面的 Gemini Live,开口还交给 VAD;边听边说做得最彻底的 GPT-Live,在 ChatGPT 里还没接上摄像头。这次核查只覆盖 OpenAI 和 Google 两家的公开状态。
SeedRealtime 把声音、画面、时序、表达统一进同一个端到端模型(一个模型直接收、直接吐,中间不转成文字)。外挂的 VAD 因此没有存在必要:轮次判断从一条外部规则,变成模型每时每刻在做的内部决定,而这个决定看得到画面。
难点也在这儿。语音天然带停顿,可以拿停顿当「你说完了」的信号,视频始终在线、没有天然分界点;而你说「这个怎么弄」的时候,模型得结合当前画面、你的手势、你的视线和前几秒的动作,才能对上「这个」是哪个。
字节跳动 Seed 随发布放出 7 段一到三分钟的实拍,按三组分:
| 这一组演的 | 场景 | 看点 |
|---|---|---|
| 看得懂画面,分得清谁在说话 | 四人聚餐 · 川菜馆点菜 | 靠外形特征把名字和人对上,七嘴八舌里分得清每句话是谁说的;服务员一句「很下饭」,它结合画面里的菜理解并翻译给外籍食客 |
| 不用你开口问,它自己看着办 | 逛博物院 · 用咖啡机 · 研读论文 | 交代一句「看到某件展品提醒我」,镜头扫过时它出声;整粒咖啡豆倒进手柄,它当场纠正,萃取完还按油脂成色建议缩短 2-3 秒 |
| 吵成一团时知道该听谁 | 大兴机场 · 陪孩子学英文 | 同伴闲聊提到「老李的航班」没被误触发,用户正式问起才作答;背景里有人在打电话,它始终跟着孩子手指的方向纠音 |
三组是同一件事的三个侧面:因为画面参与了决策,它才能看到目标就出声、才能不被旁人闲聊带偏、才能解开「这个」指的是哪个。
量化结论只有一条:相比接力传话的级联模型,音视频对话的节奏问题减少一半,指话没说完被抢断、话音落了半天没回应、被背景杂音和旁人闲聊误触发这三类卡壳。
被切断
开口的时机却总踩不准
开口的,是这个
猜晚了晾着你
合进同一个模型
该说、该接着看,
还是该闭嘴
这三类卡壳少了一半
「这个」指哪个,
眼前就有答案
下次少两三秒
- × 延迟多少毫秒,没公布
- × 模型多大,没公布
- × 7 段实拍全出自字节 Seed
这次挪动的是「什么时候开口」,
它从一只只听声音的小耳朵,
搬进了看得见画面的模型里。
