一句话:OpenAI 刚把「AI 团队」端上货架,o1 的奠基人却说,别被智能体的数量骗了

9 月底的 DevDay 2026 上,OpenAI 把多智能体从研究能力一路推到了产品主线:能全天候工作的 Dots、面向企业的 Specialist Dots、以及把编排与计算机操作开放给开发者的 Agents API。从个人助手、企业虚拟同事到开发者基建,多 Agent 贯穿了整场发布会。但就在同一周,OpenAI 研究员、o1 及后续推理模型的早期奠基者之一 Noam Brown,在一档播客对话里给这股热潮泼了盆冷水:当讨论聚焦「一万个 AI 如何协同解题」时,他先强调的恰恰是底座模型本身的能力——在他看来,多智能体容易获得超出其实际贡献的关注,而真正支撑突破的,是一个足够强的通用模型,以及让它持续运行、并行思考的能力。

Noam Brown 的核心判断:把增益归因到「智能体数量」会误导人 底座通用模型持续运行 + 并行思考是突破的主要来源贡献占比:主导(他的访谈口径) 万级智能体协作世界级难题里多 Agent 贡献不到 10%增益靠有效协作,非堆叠(「1 万 Agent」估算口径)
图 1|Brown 的拆解:万级智能体协同解题时,多 Agent 自身的增量贡献有限,底座模型能力才是大头。

「不到 10%」到底在说什么

Brown 举的例子是:用一万个智能体去解一类世界级难题,多智能体这部分带来的贡献,占不到整体的百分之十。这句话容易被误读成「多智能体没用」——但他在访谈里的意思更接近:当基础模型足够强、并且能长时间并行运转时,单纯把智能体数量往上堆,边际收益会快速变薄。换句话说,他质疑的是「数量叙事」,而不是「协作叙事」。一个足够强的单体,配合持续运行和并行思考,往往比一群沟通成本极高的智能体更划算。这个视角对当下动辄宣称「组建智能体军团」的产品话术,是一剂清醒剂。

为什么「多」不等于「强」

从 4 个、16 个到 1 万个 Agent,能力提升并不是线性叠加。决定它们能否成为高效团队的,是几个更朴素的工程问题:它们之间能否有效交流、能否共享上下文而不重复劳动、能否形成清晰分工。如果这些机制缺位,数量越多反而越乱——沟通开销、上下文污染、目标漂移会吃掉本该有的增益。Brown 的判断其实和本站近期关于开源多智能体故障的研究互为印证:真正卡住系统的,常常在「接力棒交接」的地方,而不是任何一个角色够不够聪明。

数量之外,真正决定「团队」是否高效的是这四件事 有效交流减少沟通开销与误传 共享上下文避免重复劳动与状态错位 清晰分工让每个角色做对的事 底座模型能力持续运行 + 并行思考
图 2|决定多 Agent 团队效率的,是交流、上下文、分工与底座模型,而不是智能体的数量。

诚实的地方:实验数据还没跟上叙事

Brown 没有把话说死,反而显出了克制。他坦言,目前还没有充分的实验数据,能准确说明万级规模下的协调效率究竟如何。这也意味着,「多智能体必然更强」更多是一种直觉或营销预期,而非已被反复验证的结论。至于把这种协作用于自我改进,进步可能显著加快,但仍受实验时间和算力的硬约束。对一个正在被加速产品化的方向,这种「先承认不知道」的态度,反而比动辄给出漂亮曲线的演示更可信。

更尖锐的一问:协作更好,就服务人类目标吗

访谈里最值得品味的,是那句追问:智能体之间配合得更好,并不保证它们始终服务于人类的目标。这句话把讨论从「能力」拉到了「对齐」。当越来越多的智能体协作更久、承担更多职责,我们怎么确认它们在变强的同时也变得更值得信任?这恰好和本站近期关于智能体可靠性、评测范式、安全治理的多篇稿件形成对话——产品可以把「AI 团队」做得更顺滑,但「顺滑」不等于「可靠」,更不等于「可控」。

增量认知:多智能体淘金热,需要一次降温

把 Brown 的观点放回当下,它给行业三点提醒。其一,别把资源都押在「堆数量」上,底座模型的持续运行与并行能力、以及高效的协作机制,才是真正可放大的杠杆。其二,评估多智能体系统时,要看端到端任务是否被更好地完成,而不是看它用了多少个 Agent。其三,产品叙事可以热闹,但工程落地要先回答「交流、上下文、分工」这三道题。对正在选型或自建多智能体系统的团队,这盆冷水来得很及时:先把单体的能力与合作协议打磨好,再谈规模。

边界:这是观点,不是定论

需要如实说明,以上主要来自 Brown 个人在一档播客中的访谈表述,属于研究者的判断而非官方结论,也未被大规模独立实验坐实。不同任务下多智能体的贡献占比会有很大差异——有些高度并行的搜索、生成类任务,多 Agent 的增益可能相当可观。把它当作一种「别被数量叙事带跑」的校正视角,比当成「多智能体无用论」更合适。后续值得跟踪的,是有没有团队在受控基准上系统测量「万级协作」的真实效率曲线。

结语

DevDay 把多 Agent 做成了产品,Brown 提醒我们别神话它的数量。真正值得追逐的,从来不是「多少个智能体」,而是「它们是否真的在高效协作、是否真的服务你想达成的目标」。在智能体从演示走向生产的这一年,这种冷思考比任何热词都更稀缺。