8 月 5 日,字节 Seed 发布了原生音视频全双工(能同时听和说的双向通道,不用像对讲机那样轮流说)大模型 SeedRealtime:一个统一架构同时融合音频、视频与文本,在连续的画面与声音流上实时交互——官方给它的定义是「边看、边听、边说」。而且不是纸面发布:已在豆包 App 全量上线,对话框里选「打电话」进视频通话就能体验。

想象两种沟通方式。一种是对讲机:你说完,松手,对方才能说——一来一回,轮着来。另一种是面对面聊天:对方一边看你比划、一边听你说话,还能在你卡壳时接一句、在你说到兴头上时安静听着。今天大部分 AI 语音助手还是对讲机;SeedRealtime 想做的,是第二种——而且它还长了眼睛。类比到此为止,实际差别是:面对面的人靠常识判断何时开口,它靠的是一个端到端模型在连续音视频流里持续决策。
事件

三项核心突破,已在豆包全量上线

官方发布稿把 SeedRealtime 的能力归成三项核心突破,每一项都指向「实时交互」的老毛病。

第一,音视频联合理解。声音、画面与时序信息深度融合:遇到同音词,能结合当前画面消解歧义;你说「这个怎么弄」,它能顺着你的手势、视线和画面,判断「这个」指什么。

第二,主动交互。不再被动等你提问:画面里关键目标出现时(比如你交代「看到那件展品提醒我」),它会主动开口;还能调用工具,把查到的信息融进回答里。

第三,节奏把控。实时感知你的对话状态,在该接话时自然接话、该沉默时不打断;更关键的是抗干扰——能分辨旁人闲聊和背景噪声,不被无关声音误触发。

−50%
对话节奏问题降幅
端到端人工评测口径,相比级联模型,抢话、迟滞、误触发等卡壳现象减少一半。来源:字节 Seed 官方发布稿。
7 个
真实场景案例
聚餐认人、川菜馆翻译、博物馆提醒、咖啡机纠错、论文翻页叫停、机场指路、陪学抗干扰。来源:字节 Seed 官方发布稿。
全量
豆包上线范围
对话框选「打电话」进视频通话即可体验,官方称业界率先规模化落地。来源:字节 Seed 官方发布稿。
机制

为什么「边看边听边说」这么难

要理解这次发布的分量,先看它之前的两条路卡在哪。

第一条路:级联系统(把任务拆给一串模块接力:先听、再看、最后说)语音先交给 ASR(自动语音识别,把语音转成文字)转成文字,再交给视觉语言模型理解,最后由 TTS(语音合成,把文字变回语音)说出来——模块层层串联,延迟层层叠加,信息逐级损耗。

第二条路:端到端模型(一个模型直接从输入到输出,不拆模块接力)更流畅,但官方指出不少方案仍依赖外置 VAD(语音活动检测,靠外部规则判断你说完没)判断轮次——本质上还是一问一答的半双工(同一时间只能一方说话的通道)

SeedRealtime 的解法,是把声音、画面、时序与表达统一到同一个端到端模型里:不是先听完、再看完、最后作答,而是感知、理解、决策、表达同步进行。

两条老路 vs SeedRealtime
老路一
级联串联
ASR→理解→TTS,延迟叠加、信息损耗
vs
老路二
端到端+外置 VAD
流畅但靠外部规则判轮次,仍是一问一答
vs
新路
统一端到端
感知/理解/决策/表达同步,模型自己判节奏
关键差别在「谁判断何时开口」:从外部规则,变成模型在连续音视频流里的持续决策。
字节 Seed 官方博客 相关配图 1
相关配图 1 · 来源:cnblogs.com · 数据口径以原文为准
反直觉

难的不是听清,是知道何时开口

官方的技术拆解里,最反直觉的一点是:语音其实好办,视频才是难点

语音天然有停顿,模型可以借停顿判断「你说完了,该我了」。但视频是始终在线、持续变化的:模型要不断理解画面里正在发生什么,又不能因为一点风吹草动就插嘴——它得持续判断:该关注哪个对象、该听谁说话、此刻是否应该回应。

这就是「抗干扰」的含金量。官方案例里有两个很说明问题:在大兴机场,同伴闲聊提到「老李的航班」,模型没有被这句无关对话触发;等用户正式问起,它才结合此前看到的大屏信息作答。陪孩子学英语时,背景里爸爸正在打电话、人声不断,模型却始终跟着孩子的手指纠音、造句——该出声时不迟疑,受干扰时不跑偏

一句话判断

全双工的技术门槛,不在「听得多清」,而在「何时开口」。把轮次判断从外部规则收进模型内部,是这次发布真正跨过去的那道坎。

字节 Seed 官方博客 相关配图 2
相关配图 2 · 来源:technode.com · 数据口径以原文为准
场景

7 个官方案例里,最值得留意的三个

发布稿给了 7 个真实场景案例。抛开「认人」「翻译」这些直观能力,有三个案例最能体现「边看边听边说」的含金量:

三个高含金量案例
1

博物馆「目标提醒」:你交代「看到错金银铜虎噬鹿屏座就提醒我」,它在镜头不断移动中持续留意画面,扫到展品就出声提醒,接着讲这件文物的工艺——任务保存在上下文里,目标出现即触发。

2

咖啡机「实时纠错」:你把整粒咖啡豆直接倒进萃取手柄,它当场指出「得先磨成细粉」;萃取结束,它看杯里油脂成色,主动建议「下次缩短 2-3 秒」——没人提问,它基于画面主动点评。

3

机场「闲谈记忆」:同伴闲聊提了一句「老李的航班」,它不误触发、但记住了;等你正式问,哪怕航班信息已经移出画面,它仍能调出大屏信息回答,还联网补上行李转盘位置。

这三个案例的共同点是:模型不再是「被问才答」,而是持续观察、适时介入。下面两段官方演示视频,分别对应博物馆提醒与机场闲谈记忆。当然,全部是官方演示场景,真实环境的翻车率要等你自己实测。

官方演示①:博物馆「目标提醒」——镜头扫过展品即出声提醒并讲解工艺 · 来源:字节 Seed 官方发布稿

官方演示②:机场「闲谈记忆」——不被无关闲聊触发,被正式问起时调出此前看到的航班信息 · 来源:字节 Seed 官方发布稿

动手

今天就能体验,但要用「嘈杂」来试

体验门槛很低,但「怎么试」有讲究。

体验与评估清单
1

入口:把豆包 App 更新到最新版,对话框里选「打电话」,进视频通话界面即可。

2

试抗干扰:找个真实嘈杂场景(聚餐、地铁、带娃),开着背景声跟它聊,看它会不会被旁人闲聊带偏、会不会乱插话。

3

试主动性:给它一个「看到 XX 提醒我」的任务,看它能不能在画面扫过时准确触发。

4

记住口径:「节奏问题减少一半」是官方端到端人工评测的说法,尚无第三方复测;你的实测感受比任何跑分都可靠。

SeedRealtime 跨过的坎不是「听得多清」,而是「何时开口」。把看、听、说收进同一个端到端模型,让轮次判断从外部规则变成模型自己的持续决策——这是「对讲机式 AI」到「面对面式 AI」的分水岭。豆包已全量上线,对话框选「打电话」就能试;建议直接用你的嘈杂日常来考它,别信演示。

本文事实来自字节 Seed 官方发布稿(2026-08-05)。「对话节奏问题减少一半」为官方端到端人工评测口径,未见第三方独立复测;7 个案例均为官方演示场景。体验入口:豆包 App 最新版「打电话」视频通话。