从「对讲机」到「打电话」的交互跨越

九月三十日,InfoQ 披露了开源 AI Agent 平台 openJiuwen 旗下 WorkSwarm 的全双工多模态能力。要理解它,先得弄清「全双工」:传统语音助手更像对讲机,用户说完一段 AI 才能接话,AI 说话时用户插话往往被打断或忽略;全双工则类似打电话,AI 可以边听边说,用户随时打断、补充,对话不再严格按「你说完—我再说」的回合推进。对用户最直接的改变,不是多了一个技术名词,而是等待感被压缩——不用迁就 AI 的节奏,想插话就插话。这套能力背后,是实时模型与 Core Agent 按两种节奏配合带来的全新工作体验。

半双工(对讲机)你说完我才说回合制等待→全双工(打电话)边听边说边插话等待感被压缩→WorkSwarm前台对话后台 Core Agent并行执行关键:实时音视频交互与 Core Agent 执行接入同一任务,对话和干活不再串行用户可随时展示画面、插话,把耗时工作甩给后台 Agent
图 1|WorkSwarm 把全双工对话与后台 Agent 执行放进同一个任务上下文,用户插话不再打断整体进度。

对话和干活,自此并行了

WorkSwarm 把这套能力落到办公编码场景:实时音视频交互与后台 Core Agent 执行被接进同一个任务。用户可以展示眼前画面、随时插话,也能把需要进一步处理的工作甩给后台 Core Agent。据 openJiuwen 方面介绍,这套能力并非停留在演示,已提供 Windows、Mac、HarmonyOS 等系统的一键安装包,下载安装即可体验。它解决的是个日常但真实的矛盾:查资料、做分析都需要时间,可用户的新问题随时会来,工具任务运行时 AI 还能不能继续接话?全双工给出的答案是「前台对话」与「后台执行」走两条节奏、并行不悖,而不是排队等前一个任务讲完。这种把交互与执行解耦的思路,正是长任务协作里人和 Agent 最需要的节奏感。

插话改变的是当前对话,不是整页进度

全双工最容易被误解成「AI 更聪明了」,其实它改的是交互结构。人和人交流很少严格遵守一方说完另一方再开口——看到新画面、发现理解偏了,都会直接补一句。WorkSwarm 的做法是,检测到新的有效人声就停止当前播报、转去处理新指令,已经生成的文字仍保留在任务记录里;语音活动检测与噪声门限,则用来降低背景声造成的误打断。这意味着用户可以在 Agent 朗读时直接说「先别介绍背景,直接说结论」,系统会就地切换,而不是等它把一段话念完,也不会丢掉已经算出来的中间结果。可被打断却不丢进度的特性,恰恰是长任务场景里人和 Agent 协作最稀缺的体验。

打断管理插话如何接管当前任务上下文切换上下文一致前台对话与后台执行状态需同步噪声误触发语音活动检测与噪声门限要调稳工程挑战:并行不等于无序,需要把「对话流」与「执行流」统一编排开源平台要真正好用,生态与插件仍是关键
图 2|全双工看似只是体验升级,实则引入打断管理、上下文一致与噪声误触发三类新的工程问题。

全双工背后的三类新工程题

全双工看似只是体验升级,实则引入三类新的工程问题。其一是打断管理:插话如何干净地接管当前任务、又不影响后台执行,需要清晰的上下文切换规则;其二是上下文一致:前台对话与后台 Agent 的执行状态必须同步,否则用户以为改了方向、后台还在跑旧任务;其三是噪声误触发,语音活动检测与噪声门限要调稳,否则会议室杂音就会反复打断 Agent。这些都不是模型参数量能直接解决的,而是要把「对话流」与「执行流」统一编排才能处理好,属于交互架构层面的硬功夫。

开源平台要真正好用,生态才是后半场

把 WorkSwarm 放在 openJiuwen 的整体版图里看,它延续的是这套开源平台「把智能体做进办公与编码工作流」的一贯路线。全双工多模态补齐的是交互这块短板,让 Agent 从「指令—等待—结果」的回合制,走向「边聊边干」的实时协作。但要说它已经好用到能替代人类搭档,还为时过早:一键安装降低了门槛,可真正沉淀价值的是插件生态、与既有开发工具的集成深度,以及多模态理解在复杂办公场景里的稳定表现。开源平台的后半场,拼的从来不是单次演示,而是生态密度。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。