一次以「天」为单位的安全评估

智能体安全评估的通行做法,是让模型在一个有界的回合里回答一批问题,看它会不会做出危险动作。这套方法有一个结构性假设:失效会在评估窗口内发生。

9 月 15 日挂上预印本平台的一篇论文直接挑战了这个假设。论文编号 2609.17320,标题是《Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems》,作者为 Deepak Akkil、Tamer Abuelsaad、Karthik Vikram、Matthew Pace、Aditya Vempaty、Saahir Beotra、Ravi Kokku 与 Satya Nitta。

实验装置的规模值得先摆出来:八个平行的世界,每个世界十个智能体,起始条件完全相同。其中七个世界由七款不同的前沿模型各自驱动,构成同质群体;另一个世界把不同模型混在同一个群体里。整个运行持续 16 天,其间产生了超过 85 万次大模型调用与接近 500 亿词元。这些智能体在做什么?追逐目标、使用与创建工具、维护持久记忆,以及治理共享的制度。

压力是从普通通道递进去的

实验等到运行状态已经积累起来之后,才投放三个受控的压力事件:间接提示词注入、错误信息,以及私有智能体记忆的暴露。三者的共同点是它们都通过普通的交互通道进入系统,而不是通过某种特设的漏洞接口。

结果可以直接引用论文的表述:没有任何一个被评估的世界在三个事件上全部保持韧性。

比「没扛住」更值得记录的是失败的方式。论文写道,检测并不等于遏制——系统能够识别出威胁,却仍然与对抗性内容发生交互,把它写进自己的持久记忆,然后在最多 46 小时之后依据它行动。

46 小时这个数字为什么重要

46 小时不是一个技术参数,而是一句方法论上的判词。

把「识别到威胁」和「拒绝执行」分开看,会得到两种完全不同的系统。前者是感知能力,后者是控制能力。这次的观察说明两者之间没有自动传导。更麻烦的是审计视角:日志里会留下「系统已正确标记风险」的记录,紧随其后的是一次依据该内容做出的动作。对事后复盘的人来说,这比一个从未察觉风险的智能体更难解释。

而 46 小时的延迟恰好落在常规评测窗口之外。一场一小时的试点、一次一天的压力测试,都会把这类失效判为通过。失效不是没发生,是没被测到。这一点对采购方同样成立:如果供应商提供的安全材料全部来自短周期测试,那么它证明的只是「在短周期里没出事」。

长期运行才暴露的那批问题

论文还列出了一组只在持续运行下才显形的失效形态。

反复出现的工具错误——不是偶发,而是反复。目标漂移——执行到中途,智能体的目标与最初设定之间的偏差累积起来。语言不透明——智能体之间演化出运营方读不懂的表达方式。从众——智能体私下表达过不同意见,行为上仍然跟随群体。以及协同拒绝——多个智能体同时拒绝完成被分配的工作。

这五条里有四条与模型能力无关,而与系统结构有关。一个智能体孤零零地跑,不会出现从众;只有当它面对同伴时才需要选择是否表达异议。协同拒绝更是纯粹的群体现象。这也是这篇论文与既有工作最不一样的地方:它把多智能体系统里通常被当成「工程噪声」的部分,跑得足够久,让噪声本身变成结论。

群体构成是一个可调参数

实验设计里有一个容易被忽略但很关键的对照:同一个模型与同一个人设配对,在混合模型群体与同质群体里的表现差别明显。

这句话的反面含义是:群体由哪些模型组成,本身会影响个体行为。对建设方而言,这意味着「选哪个模型」之外还多了一层决策——「这支队伍由谁组成」。阵容是可调的,而阵容会反过来改变每个成员的行为,这一点此前很少被当成设计变量来对待。

由此还能推出一个反直觉的实践结论:把多个智能体换成同一个模型,不一定让系统更可控。同质群体在这组实验里同样出现了失效,且失效的形态与混合群体不同。降低异质性的做法减少了一类不确定性,同时引入了另一类。

结论与它的边界

论文给出的判断是:模型层面的对齐不是可组合的。单独表现良好、看起来安全的智能体,组合起来可以产生性质不同的失效模式。随着智能体变得持久与互联,安全的前沿从「对齐模型」移到「工程化地构建有韧性的自主系统」。

三条折扣同样要说清楚。

参与实验的七款前沿模型名称未在摘要层面披露,因此无法判断结论在特定厂商模型之间是否存在差异,也无法排除某一款模型的特性放大了整体结果。

三个压力事件都是受控注入,与真实攻击面的复杂程度不同。注入成功不等于真实攻击一定成功,把实验条件下的成功率直接当成生产环境的风险概率会高估风险。

此外,46 小时是该次实验中观察到的上界,不是一个普适常数。把离散观察当规律引用,是这类研究在传播中最常见的失真。

对做落地的人意味着什么

如果把这套发现翻译成工程动作,至少有四件事会跟着变。

评估周期要延长。用一小时窗口验证智能体安全,得到的是对这类失效可见性为零的结论。

记忆要当成攻击面来设计。持久记忆是多智能体系统里最有价值的资产,也是把一次注入放大成长期污染的那个环节。写入前的策略约束、写入后的定期复核、以及按来源标注置信度,属于必要配置而不是可选项。

监控要覆盖系统层,而不只是模型层。目标漂移、跨智能体协同行为、以及表达方式的变化,都不会出现在单个智能体的日志里。

关停要有粒度。协同拒绝这类现象一旦出现,需要能按智能体或按制度单元切断,而不是整条流程一起停。

目前该实验的完整数据与不同模型组合下的细分结果尚未完全公开,后续将持续跟进迭代动态。