多智能体系统正从演示走向生产,但多数讨论还停在「单个智能体有多强」上。9 月 15 日提交到 arXiv 的一篇论文(编号 2609.17527,标题 Agentic Societies Need a Social Harness)把问题推到另一层:当一批智能体代表目标并不完全一致的不同委托人,跨信任边界自主协作时,单靠每个智能体各自的护栏,远远不够。
什么是 agentic society
论文给了一个清晰的定义:agentic society 是一群 AI 智能体的集合,它们跨越信任边界相互协调,各自代表不同的委托人,而这些委托人的目标只是部分对齐。现实里这并不遥远——采购智能体、法务智能体、运维智能体分属不同团队,为了完成一笔订单或一次发布而临时组队,正是这种形态。
在这种结构里,麻烦往往不在某一个智能体「坏掉」,而在智能体之间的交互本身。论文通过实验指出:即便每个智能体都诚实、都能干,用现有 harness 与消息原语协作时,常常还是无法达成令人满意的结果;而一旦其中出现故障或恶意智能体,它可以通过利用「发言」(也就是通信内容)来拖慢协作、影响走向,甚至推进别的有害目标。
今天缺的是「社会层」护栏
现在每个智能体都有所谓 personal harness:它管的是这个智能体的私有上下文与记忆,管的是它和「自己的委托人」之间的通信,也管工具调用与权限边界。但它只管「自己」,不管这个智能体和其他智能体之间怎么打交道。
论文主张补上 social harness:一层专门管「智能体之间」的规则与后果。它要解决的不是「某个智能体能不能用某个工具」,而是「一群智能体聚在一起时,什么样的交互是被允许的、什么样的信息是可被信任的、出了事谁负责」。
三层 social harness 怎么设计
论文提出了一个分层架构,把 social harness 的能力拆成三块:
- 事前拦截:把一类已知的失败模式直接挡在协议之外,让某些危险交互根本无法发生;
- 运行时识别:让智能体在交互过程中检测无效消息,而不是等结果出错才回头查;
- 事后追责:保留调查与后果机制,使恶意或故障智能体的行为可被追溯与处置。
这三层不是替代单个智能体的能力,而是给「智能体之间」补一套社会规则与后果。
它和「通信底座」类工作是什么关系
近期已有不少工作集中在通信底座上,例如给多智能体加一条共享总线、定义讨论与质疑等交流意图。这一类工作解决的是「怎么把话说通」,而 social harness 关心的是「话里有没有陷阱、越界了怎么办」。两者是互补的:先把通道建起来,再决定通道上哪些话能说、说了要担什么责。论文的立场是,没有社会层护栏,再多通信原语也只是在更快地扩散错误。
为什么现在提这个刚好
多智能体编排正在被主流平台当成一等能力来推,智能体之间的调用与委托会越来越频繁。当协作发生在同一家公司的可信环境里,风险尚可内部消化;一旦跨组织、跨委托人,缺乏社会层护栏的代价会迅速放大。论文的价值不在于给出一套现成标准,而在于把「智能体社会也需要护栏」这个被长期忽略的维度,明确立为一个独立的研究与工程问题。
对正在把多个智能体拼进生产流程的团队来说,这篇论文最直接的提醒是:评估一套多智能体方案时,别只看单个智能体的表现,也要问清楚——它们之间靠什么规则约束,越界时能不能识别,出事时能不能追责。