一个眼镜场景倒逼出来的架构题

想象你戴着智能眼镜问助手一个问题,它沉默 30 秒去思考——这个体验是完全不可接受的。腾讯混元语音团队联合多所高校发布的 Gander 模型,就是从这类硬件的交互形状倒推出来的架构尝试:让模型一边跟你持续说话,一边在后台把复杂任务干完。技术报告 9 月 8 日挂上 arXiv,9 月 12 日修订,代码已按 Apache-2.0 在 GitHub 开放。

Gander 双模块:小脑管秒级对话,大脑管后台智能体任务小脑(9B)实时对话管控基座 MiniCPM-o 4.5大脑(可替换)推理与智能体任务Codex、Claude Code 均可一秒一分段预测听说停两分钟滚动记忆免独立 VAD 模块provider 注册表换大脑不重训小脑用户随时插话,模型主动追问或播报进度设计动机:眼镜类无屏硬件不能容忍助手沉默 30 秒去想问题
图 1|Gander 把对话与任务拆给两个模块:9B 小脑按秒分段决定听说停,两分钟滚动记忆替代独立 VAD;大脑是可插拔的通用智能体,仓库内置 Codex 接口,Claude Code 在论文中被点名。

当前的语音助手大多是回合制:你说完、它答、再轮到你。但真实对话是打断、插话、边听边说。Gander 同时接收语音、图像和文本,即使在它自己输出语音的时候也能继续处理输入,支持随时打断,还会不用你问就主动追问或播报任务进度。

小脑与大脑:一秒一分段,大脑可插拔

对话要快、推理要慢,一个模型很难同时做好,于是 Gander 把工作拆给两个角色,命名借用了人体解剖:小脑是一个基于 MiniCPM-o 4.5 的 9B 模型,把对话切成一秒一段,逐段预测该听、该说还是该停,用大约最近两分钟的内容当滚动记忆,连独立的语音起止检测模块都省了。大脑则是一个不需要任何额外训练的通用智能体,论文点名 Codex 和 Claude Code 都能放进这个位置,代码仓库目前内置了 Codex 的接入层,测试中该位置由 GPT-5.6 家族中一个未具名的模型担任。底层模型升级,整套系统跟着受益,对话侧不用重训。

Full-Duplex-Bench v3:礼貌领先,准确垫底打断用户比例(越低越好)8.0(Gander)13.5(GPT-Realtime)47.9(最弱系统)严格 Pass@1(越高越好)0.600(GPT-Realtime)0.400(Gander)大脑纯文本直供时工具选择 0.934 超过 GPT-Realtime 的 0.876读图要点:语音通道是主要损耗来源,51.6 的回合以占位语开头也是代价
图 2|Gander 在打断率上领先所有对手、时机全场景正确,但任务准确率垫底;把大脑改为纯文本直供后工具选择反超 GPT-Realtime,说明损耗主要在语音通道而非智能体本身。

礼貌考了满分,干活考了末位

基准成绩是一把双刃剑。在测试语音助手时机表现的 Full-Duplex-Bench v3 上,Gander 在全部 100 个场景中都在正确时机开口,打断用户的比例只有 8%,低于 GPT-Realtime 的 13.5%,更远低于最弱竞品的近 48%。但任务准确率上它排到了末位:严格 Pass@1 只有 0.400,GPT-Realtime 是 0.600。研究者的归因是测试给整套系统打分,语音识别和语音输出的误差都被计了进去——当把大脑改为纯文本直供时,工具选择得分升到 0.934,反超 GPT-Realtime 的 0.876。换句话说,损耗主要在语音通道,不在智能体本身。

代价清单还有两项:51.6% 的回合以「我看一下」这类对话占位语开头,用寒暄维持对话的活着的状态;音视频理解弱于其基座模型,训练方向偏流畅对话、牺牲了精确感知。模型用约 270 万个样本训练,其中一部分专门教它在背景嘈杂或多人对话没人和它说话时保持安静。权重与训练数据方面,团队表示将在开源流程完成后对外公开,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

评价体系的空档,比分数更值得记

研究者自己在报告里承认:目前没有专门针对这类全双工加智能体模型的测试,只能借用现成基准,导致整套系统被统一打分、链路误差相互污染。评价体系缺位本身就是这个方向的行业现状——谁先做出像样的双脑系统基准,谁就掌握了下一个语音交互赛道的度量衡。从更远处看,把对话与推理拆到不同模块的做法正在成为跨厂商的共识趋势,OpenAI 的实时语音产品同样在把重任务委托给后台模型,只是各家拆分的位置和开放程度不同。

这个项目真正的增量认知在于:全双工语音和后台智能体的解耦,正在成为端侧硬件的标配形状,而 Gander 是目前把这套架构完整开源、并把代价数据如实摆出来的那一份。对做语音智能体的团队来说,这是一份可以直接对表的设计参考,也是一面照出「礼貌与能力不可兼得」这一当前取舍的镜子。