一篇题为《Black-Box Red Teaming of Agentic AI》的论文(arXiv 2609.09647,2026 年 9 月发布)把智能体安全评测往前推了一步。它的核心主张很朴素也很尖锐:今天大多数红队工具还在用「单轮聊天」的思路测智能体,但真正的危险发生在多步任务里——智能体读了不该读的文件、被注入带了节奏、把 A 智能体的输出直接喂给 B 智能体。这些失稳不在某一句话里,而藏在任务链路的中段。论文给出的,是一套不需要特权访问、只要基础系统描述就能跑的黑盒红队框架。
七域分类、自动造场景、裁判打分
框架分三步。其一是七域风险分类法,把智能体可观测的行为映射到风险类别,先有一张统一的「风险地图」。其二是 SAGE-RT 自动红队,针对每个风险域自动生成 120 个对抗场景,把抽象的威胁变成可执行的测试用例。其三是用 LLM 当裁判打分,并且由人工校验裁判结果,缓解「模型评模型」自身的偏差。整个流程的关键约束是黑盒:它不要求拿到模型内部状态或训练细节,只需一份基础系统描述就能发现架构级漏洞。
增量认知:把红队从「测一个聊天机器人」升级为「测一套会互相传话的智能体系统」,是这篇论文最有价值的转向。单轮评测永远测不到智能体之间的数据通路——而恰恰是这条通路,成了隐私泄露与越权行为的新出口。
这种「分类、造场景、裁判」的三段式,好处是可规模化。传统红队靠人写对抗样本,覆盖面有限;SAGE-RT 把造场景自动化后,每个风险域都能批量产出测试用例,再由裁判统一评估。对正在把多个智能体拼进生产系统的团队来说,这意味着可以较低成本做一次「架构体检」,而不是等出事再复盘。
实测数字:多智能体隐私风险 65,行为漏洞 85
论文在 CrewAI 与 AutoGen 两种智能体架构上、跨四种基础模型做了验证,结果相当扎眼:平均治理风险 56,多智能体配置下的隐私风险达 65,而智能体行为漏洞率最高摸到 85。也就是说,当第二个智能体加入、一条数据通路在智能体之间打开,隐私风险显著抬升——单轮聊天评测根本不会去测这条路径,数字自然好看,真实部署却未必。
这个数字最该被读出的,不是「某某框架不安全」,而是「危险随架构形态变化」。单个聊天机器人只有一对输入和输出,现有安全工具基本覆盖;但多加一个智能体,就多了一条彼此传递数据的通道,而这条通道上没有人为设计的边界。信息在一个智能体那里不该说,流到另一个智能体那里却可能被毫无顾虑地转交——隐私就这样在智能体之间静静流动。
对建设者的三点实在提醒
抛开论文的方法细节,它对正在搭多智能体系统的团队有三条可操作的提醒。其一,别再用单轮对话的评测标准替多智能体背书,要在测试里显式构造「智能体之间传数据」的场景。其二,在智能体之间加边界,而不是只在外围做护栏——权限、脱敏、最小可见集,应该跟着数据通路走,而不是只守着用户入口。其三,用黑盒、低成本的自动化红队做常态体检,把「能跑通」和「安全」分开验证。
边界提醒:论文测得的是架构层面的风险倾向,并非某款产品的绝对安全评级;56、65、85 这类数字是跨模型、跨架构的统计结果,不能简单套到某一个具体部署上。但它揭示的规律——多智能体配置放大隐私与行为风险——值得每个多智能体建设者当作设计输入。
这篇论文的价值,不在于抛出一组吓人的数字,而在于把「智能体安全」从单点提示注入,推进到「多步、多体、跨通路」的结构性评测。当行业忙着把智能体从演示搬上生产,这类黑盒、可规模化的红队框架,正是补上那块一直被忽略的体检表。