绝大多数智能体安全评测,默认了一个不现实的设定:用户是被动的,控制是静态的。可真实部署里,智能体要跟人、跟工具、跟外部系统打交道,用户这一方既可能善意协作,也可能被 adversary 借来推着环境走向危险。一篇新近提交的论文 DUMA-Bench(Dual-Control Multi-Agent Benchmark)要测的,正是这种「双控」条件下的安全性——当智能体和用户都能改写共享环境状态时,系统还撑不撑得住。
DUMA-Bench 在 τ2-bench 之上叠加了对抗环境,覆盖八类漏洞,包括 RAG 投毒、跨智能体操纵、不安全输出处理等;评测对象横跨五个模型家族的 14 个模型(OpenAI、谷歌、Anthropic、深度求索、通义与 Z.ai),分布在八个业务域,并跑多种用户行为 regime。它的实验结论很扎眼:把双控交互引入后,攻击成功率从 26.9% 跳到了 41.1%。
安全不是模型属性,是三方交互的产物
这个跳升说明一件事:智能体安全不能只盯着模型本身。同样的模型,在「用户只是旁观者」的设定里可能表现尚可,一旦用户也能改环境状态、且动机未必善意,失败率就明显抬升。论文的论点正在于此——安全性从模型、用户与环境的互动里涌现,而不是某个模型的固有标签。这对采购与评测的提醒是直接的:只拿模型在被动用户设定下的分数说事,会系统性低估真实部署的风险。
要理解这个跳升是怎么来的,得看 DUMA-Bench 的构造方式。它没有直接另起炉灶,而是在 τ2-bench 这套已有的多智能体业务基准之上,叠加了一层对抗环境:原本只由智能体操作的工具与状态,现在也向一个可能不合作的「用户」角色开放,后者可以主动注入指令、篡改共享状态,甚至在多轮交互里逐步把环境推向危险配置。论文还特意让用户角色在多种 regime 之间切换——有的全程配合,有的中途变卦,有的从一开始就带恶意——用以模拟真实部署里用户可信度参差不齐的现实,而不是把「用户」当成一个常量。这种把变量显式化的做法,正是后续评测值得跟进的方向,也让「安全水位」从此有了可比的基线。
放到工程语境,DUMA-Bench 的价值在于把「交互动态」从笼统的担忧,变成可计量的增量。过去我们常说「多智能体协作要小心被带偏」,却很难说清到底偏多少;现在至少有了把双控这一变量单独拎出来比较的标尺。但也得泼盆冷水:基准跑出 41.1% 的相对提升,是实验环境里的相对增幅,不代表真实系统里的绝对水位。它给的是方法论,不是安全保证书。
更进一步的含义落在评测方法论上。过去一年主流智能体基准大多把「用户」设为常量,比较的是不同模型在同样被动环境下的表现;DUMA-Bench 把用户变成变量后,等于提醒行业:任何固定用户设定的基准,测出的都只是「理想对手」下的安全水位。要把结果用进采购或上线决策,至少得补做一轮把交互动态、权限边界与用户行为一并纳入的评测,否则高分很可能来自受试者恰好没被推到危险区间。当然,基准本身也有局限——它的对抗环境是受控构造,真实世界的用户动机与攻击手法会比实验更复杂,结论宜作方向上的参考,不宜直接当成安全承诺。
对要上多智能体工作流的团队,更该记下的结论是——把用户侧的可信度、权限边界与行为校验一并纳入评测,否则你测的只是模型,不是系统。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。