9 月 23 日的产品发布潮里,一个名为 Fez 的开源框架被摆上台面,定位很直接:让一组 AI 智能体像团队一样协作,并共同把决策定下来。同一天露面的还有不少智能体相关新品——WZRD 做 AI 原生文档、Clueso MCP 用对话剪视频、Plane Agents 把任务派给智能体如同派给同事、PixelCrew 是一支设计智能体小队、WeWeb MCP 让智能体搭应用、SereneDB 与 Anomalo 则分别补上面向智能体负载的数据库与数据质量。Fez 不算最热闹的那个,但它点出了一个被反复讨论、却少有开源实现的设计取向:多智能体集体决策。

Fez 的思路:先提案、再辩论、后共决

集体决策框架的骨架通常是这样:多个智能体各自拿出方案与依据,接着互相挑缺漏、亮反对点,然后按既定规则收敛成一个统一路径,最后落地并把经验回流。关键在「辩论」这一步——它把单一模型的临场判断,换成多视角的交叉质证。直觉上,这会缓解「一个模型自己拍板」时的盲区与过度自信,也更容易追溯:最终结论是怎么被争出来的,比一句「模型说行」要透明得多。

Fez 的思路:让一组智能体像团队一样把事定下来 提案 各智能体给方案 带依据 辩论 互相挑缺漏 亮反对点 决策 按规则收敛 选定路径 执行 落地并回流 经验 关键在「辩论」这一步:把单一模型的临场判断,换成多视角的交叉质证 风险也在这:协调成本、群体盲从、责任归属,都比单智能体更难厘清
图 1|集体决策把「一个模型拍板」换成「一组智能体交叉质证」,代价是协调与归因变复杂

但代价同样清楚。协调多个智能体本身要消耗 token 与时间,复杂任务里还可能演化出群体盲从——大家都往同一个错误方向靠,辩论变成走过场。更麻烦的是责任归属:一个由集体定下的坏决策,到底算谁的?这些都不是把几个模型并排摆好就能解决的,需要在协议层把「何时投票、何时委托、何时请人」写清楚。

多智能体协作是一族设计选择,不是一种范式

把 Fez 放进更大的图谱里看,它会更清楚。SAT(斯坦福与 Together AI)走的是自组织协作剧本:用极少量样本学出可迁移的协作剧本并冻结,供多模型复用;GCCE(见本批 1381 篇)走的是竞争式演化:两组互评、胜者沉淀技能,用外部压力逼出盲区;Agensh 则尝试无中央编排器的涌现式协作,角色临场涌现。四种取向各有适用面:要稳用专人专线,要广用竞争互评,要自适应用自组织,要透明可追用集体辩论。

多智能体协作不是一种范式,而是一族设计选择 Fez:集体辩论决策 多智能体提方案、互辩、共决 重在交叉质证降盲从 尚处早期开源阶段 SAT:自组织协作剧本 少数样本学出可迁移剧本 冻结后多模型复用 斯坦福与 Together AI GCCE:竞争式演化 两组互评、胜者沉淀技能 用外部压力逼出盲区 见本批 1381 篇 Agensh:涌现式编排 无中央编排器自组织 角色临场涌现 与 SAT 不同论证 选型看任务:要稳用专人、要广用竞争、要自适应用自组织、要透明用辩论
图 2|集体决策只是多智能体协作的一种取向,与自组织、竞争、涌现式各有适用面

对想上手的人,务实建议是别先问「该选哪个框架」,先问「我的任务怕什么」。怕单一模型盲从,就上交叉质证;怕过早收敛,就上竞争机制;流程反复出现,就把它固化成剧本。Fez 当前仍处早期开源阶段,公开基准与大规模案例还不算多,把它当作一种「协作范式样板」来研究,比当作生产底座更合适。

也需要提醒,集体决策框架对提示词与辩论规则极其敏感。如果「辩论」只是让每个智能体各说各话、最终靠一个简单的多数票收口,它并不会自动比单个强模型更可靠,反而可能把 token 成本堆高、把责任稀释。真正有价值的设计,是让反对意见能被结构化记录、让收敛规则可审查——否则「团队决策」只是给单点失误换了一层更厚的包装。

对开发者而言,Fez 的价值不在于「几个模型一起答」这个噱头,而在于它把决策过程显式化了。当每一步提案、反对与收敛都被记录下来,调试智能体就不再是调一个黑箱,而是调一套可观察的协作流程。这恰恰是当下多智能体系统最缺的工程纪律。

值得肯定的是,Fez 把「多智能体如何做决定」这件事摆到了台前。过去年多智能体文章多盯着「怎么拆任务、怎么调工具」,决策环节常被默认成「模型自己定」。当智能体开始接手真金白银的动作,决策的可解释与可追责会变得和准确率一样重要。集体决策未必是终局答案,但它提醒行业:智能体的下一道坎,可能不在会不会干,而在怎么证明自己干得对、且说得出为什么。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。