8月5日,字节跳动宣布推出原生音视频全双工大模型 SeedRealtime,并在豆包 App 全量上线。与市面上一众「语音转文字再对话」的方案不同,SeedRealtime 用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来「边看、边听、边说」的体验。它不是给豆包加了一个语音入口,而是把交互范式从「一问一答的文本流」推进到「持续在场的多模态流」——AI 助手开始具备环境感知与社交智能,而不只是被动应答的聊天框。

一、全双工与全模态:为什么「原生融合」是关键

当前多数语音助手走的是「识别—理解—生成—播报」的串联链路,音频与文本在中间被拆开,延迟高、且无法在说话的同时理解对方。SeedRealtime 的关键在「原生」二字:音频、视频、文本在同一套架构里被联合建模,模型直接消费连续的音视频流,而不是先转成文字再处理。这让它能够全双工工作——用户说话时它可以听、可以打断、可以边看画面边回应,而不是等一方说完。对「实时性」要求高的场景(通话、陪伴、现场协助、车载),这种低延迟、可打断、带视觉的连续交互,比单次问答更有用。

二、从文本工具到「全能 AI 伴侣」

SeedRealtime 全量上线,是豆包定位升级的明显信号。过去豆包常被视作「文本对话工具」,而 SeedRealtime 带来的主动交互能力与抗干扰能力,意味着它能在不被唤醒的情况下感知环境、主动接话、在嘈杂或多说话人场景里保持理解。这与豆包此前接入特斯拉车机、做「阿宝」式全端 AI 化的路径相互呼应——字节正把豆包从「能聊天的 App」做成「嵌在设备与环境里的伴侣」。当 AI 能边看边听边说,它适配的就不只是手机,还有眼镜、车机、音箱等任何有摄像头与麦克风的表面,这正是端侧与多模态 Agent 的下一站。

三、坐标参照:全模态交互的三条路线

把 SeedRealtime 放进全模态交互的版图,路线之争已现分野。OpenAI 的 GPT-Live 主打双向实时语音、强调自然打断;谷歌 Gemini Spark 把个人 Agent 与浏览器深度整合,做「代你办事」;阿里 Qoder Voice 则把实时语音交互率先落在编程场景。SeedRealtime 的差异化在于「音视频文本统一建模 + 豆包亿级用户的全量铺开」,它不只验证技术,更在用流量验证「用户是否真的想要一个能看能听的伴侣」。全模态交互的比赛,本质上是在抢「下一代人机入口」——谁的交互最自然、覆盖设备最多,谁就更接近那个入口。

四、客观看:体验跃迁与待解难题

价值在于,SeedRealtime 把「实时、可打断、带视觉」的全模态交互以原生架构落地到亿级产品,是全模态 Agent 从演示走向大规模消费级应用的重要一步,也为豆包在智能体入口之争中补上关键拼图。但边界要讲清:其一,发布信息来自每经等媒体报道,模型的具体参数量、延迟指标、功耗与端侧适配范围行业暂未完全披露;其二,全双工、多说话人、抗干扰在真实嘈杂环境中的稳定性,仍需用户规模验证,演示流畅不等于全天候可靠;其三,持续「看」与「听」带来隐私与数据边界的新问题,尤其在车载、家居等常开场景,透明告知与权限控制要跟上;其四,多模态交互的「主动接话」若把握不好分寸,容易从「贴心」变「打扰」。SeedRealtime 是一次扎实的能力跃迁,而它能否沉淀为日常习惯,取决于字节在体验分寸与隐私治理上的持续打磨。