2026 年 9 月 23 日前后,OpenAI 给 ChatGPT 移动端的 Work 入口接入了语音智能体: Plus 与 Pro 用户可以用说话的方式,让智能体去整理文档、梳理邮件与 Slack、搭一个简单页面、跑演示,甚至操作云端浏览器和处理财务类任务。底层由 7 月发布的 GPT-Live 模型驱动;免费与 Go 套餐暂时只提供插件形态,不开放完整语音执行。这件事本身不算一次大模型能力的跃迁,但它把「怎么叫醒智能体」这件事往前推了一步——从打字,变成说话。

语音把「打字提问」换成「说话指挥」

过去 ChatGPT Work 的形态,是人在对话框里打字下达任务,智能体在后台调度工具。语音入口是在这之上加了一层自然语言触发器:用户用口语化的指令,比如「把本周的客户反馈整理成周报发到 Slack」,模型理解意图后拆成可执行步骤,再去调用文档、邮件、建站、浏览器等能力。对不在键盘前的场景——通勤路上、走动中——这种触发方式明显降低了使用门槛。门槛降低的另一面,是智能体被调用的频率与场景都会变宽。

语音把「打字提问」换成「说话指挥」 用户说话 口语化指令 「整理这周周报」 理解意图 GPT-Live 模型 拆成可执行步骤 调度工具 文档 / 邮件 / Slack 建站 / 浏览器 / 财务 回结果 页面 / 摘要 直接可用 底层由 7 月发布的 GPT-Live 模型驱动,免费与 Go 套餐暂仅提供插件形态 语音降低了「让智能体干活」的操作门槛,也把错误指令的传播速度一并放大
图 1|语音把触发方式从「打字」变成「说话」,智能体在后台调度一组工具完成任务

这也和 ChatGPT Work 既有的「把工作流搬进对话框」形成层次区分:语音不是替代对话框,而是给对话框加了一个更顺手的入口。对普通用户而言,差异在于「我不必坐到电脑前也能派活」;对产品而言,差异在于智能体的触发面从「人主动打开应用」扩到了「人随时开口」。这类变化看似细微,却是智能体从工具变成随身执行层的必经过程。

和 Anthropic 的路线并不一样

把视野拉到行业里看,同样是给智能体做入口,OpenAI 与 Anthropic 的选择并不相同。OpenAI 这次保持聊天与 workspace 分离:语音只作为 Work 入口的触发器,聊天归聊天,执行归执行层,边界清晰、便于分场景治理。Anthropic 走的是 Cowork-Chat 合并式路线,把对话与协作合为一体,协作对象本身也可以是智能体,更强调「边聊边做」。两种取向没有对错,只是把「智能体该在哪一层接手」这个答案,放在了不同的位置。

同样是语音入口,两家的产品取向并不相同 OpenAI:聊天与 workspace 分离 语音是 Work 入口的触发器 聊天归聊天,执行归 workspace 边界清晰、便于分场景治理 移动端优先铺开 Anthropic:对话与协作合并 Cowork-Chat 把对话即工作流 协作对象也是智能体 更强调「边聊边做」 桌面与团队场景为主 两条路线没有对错,只是把「智能体该在哪一层接手」的选择做在了不同位置 对开发者而言,接入协议与权限模型会因取向不同而有明显差异
图 2|OpenAI 把语音当触发器、聊天与执行分离;Anthropic 把对话与协作合一,两种取向各擅其场

对开发者来说,取向不同会直接反映在接入方式上:OpenAI 这套更利于分场景做权限与审计,Anthropic 那套更利于把协作流一体化。短期看是产品体验差异,长期看会影响生态里「智能体应用长什么样」。值得记一笔的是,语音入口的出现,会让跨产品的智能体互操作变得更值钱——当触发方式趋同,比拼的就会回到背后的工具广度与可靠性。

免费与 Go 套餐为什么只给插件

一个耐人寻味的细节是,语音智能体完整能力先向 Plus 与 Pro 开放,免费与 Go 套餐只给插件形态。这背后是两层考量:其一是成本,语音触发带来的工具调用与算力消耗远高于纯文本问答,先锁住付费层级等于先锁住可控的负载;其二是风险,语音发起的是真实动作,一句口误可能让智能体批量发错消息或建错页面,限制范围也等于限制事故面。厂商对「用语音发起真实动作」仍持审慎,本身就是一个信号。

风险同样被放大

语音降低了使用门槛,也把错误指令的传播速度一并放大。打字时人还有机会在发送前检查,说话则更依赖模型对意图的准确理解,一旦理解偏了,智能体可能执行一连串错误操作。这要求产品层必须有更强的意图确认、执行预览与可撤销机制,而不能只把语音当成更方便的输入框。对行业而言,语音入口证明了「自然语言即操作」离日常更近,但也提醒所有人:触发越容易,兜底越要扎实。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。