智能体安全的研究不少,但「大家到底在测什么、没测什么」这件事,长久缺一张总图。一篇题为《Connecting the Dots in Agentic AI Security》的综述(arXiv 2609.23894,2026 年 9 月)做了这件事:它系统梳理了 2022 至 2026 年间的 66 项研究,提出一个跨维表示(S 功能面、B 边界、P 属性、A 架构),把一条威胁拆成四个维度——S 是受影响的功能或系统面(系统、工具、数据),B 是交互或信任边界(人-智能体、智能体间),P 是被违反的安全属性(机密、完整、可用),A 是被实测的架构(单智能体、多智能体、长时程)。一条完整的威胁,等于在四个维度各取一点再连成链路。这套框架的价值不在命名,而在把过去各写各的威胁分类法对齐到同一张坐标上。
T 四维表示:把威胁按四个维度重新摆位(arXiv 2609.23894)S 功能面系统 / 工具 / 数据B 边界人-智能体 / 间P 属性机密 / 完整 / 可用A 架构单 / 多 / 长时程一条威胁 = 四维各取一点,连成一条链路实证集中区提示 / 推理 · 记忆 · 工具中介,多在单智能体评测盲区持久 · 人-智能体 · 多智能体 · 系统级 · 长时程
图 1|T 四维表示把威胁对齐到同一坐标;证据集中在单智能体攻击,长时程与多智能体是盲区。
论文的第二块工作更有信息量:它把 22 项有工件支撑的红队研究与 11 个代表性安全基准拉出来,刻画实证的覆盖成熟度。结论直白——证据集中在提示与推理、记忆、以及工具中介的攻击上,而且大多在单智能体设定里;而持久状态、人-智能体交互、复杂多智能体、系统级与长时程这几类威胁,得到的覆盖明显偏少。换句话说,红队们反复在测的是同一块相对好测的靶子,真正麻烦的那几类——跨多个智能体传话、跑很久才暴露、牵涉系统整体——反而少人碰。论文据此给出 13 个开放研究问题,方向是更系统、架构感知、可复现的安全评测。
评测成熟度失衡:66 项研究里的证据分布反复被覆盖单智能体 + 提示 / 推理 / 记忆 / 工具攻击几乎空白持久 · 人-智能体 · 多智能体 · 系统级 · 长时程22 项红队研究大多黑盒、单轮、单智能体设定11 个基准指标异构、自适应防御评测少、架构失衡13 个开放问题指向:更系统、架构感知、可复现的安全评测
图 2|红队反复测同一块好测的靶子,真正麻烦的多智能体与长时程威胁少人碰。
对采购与落地团队,这篇综述最实用的地方是把「安全评测成熟度」从一个口号变成可核对的清单。过去厂商一张红队成绩单就能让人安心,但清单里若全是单智能体提示注入的通过率,它其实只覆盖了最窄的一块。要问的是:长时程任务里跨多步的越权、智能体之间互相传话泄露的隐私、系统级资源滥用——这些有没有被自己的评测覆盖?没有的话,成绩单越漂亮,盲区越危险。真正该追的不是红队数量,而是评测覆盖了哪些维度、哪些维度至今没人碰。这也解释了为什么同一份安全能力在攻防两端的成熟度会差这么多——守方先把好测的测了,难测的留到了出事之后。 这篇综述和本栏目此前覆盖的黑盒红队框架(arXiv 2609.09647)不是一回事,注意区分。那篇给的是一套可操作工具:七域分类加 SAGE-RT 自动造对抗场景,目标是让团队低成本给自己的多智能体系统做一次架构体检;本篇是站在一旁对整片田野做元综述,指出评测成熟度的结构性失衡。两者互补:一个教你怎么测,一个告诉你大家测偏了哪。对正在把多个智能体拼进生产的团队,这篇的增量认知很实用——别只盯着单智能体提示注入的红队报告自我安慰,长时程与多智能体那块才是评测盲区,恰恰是隐私泄露与越权行为的新出口。 当然,综述有综述的边界。作者明确说,证据分布描述的是被纳入的那批文献,不代表全行业 empirical research 已无空白;66 篇里的方法指标并不统一,自适应防御评测少、架构覆盖失衡、执行状态捕获不完整,这些本身就限制了跨研究的可比与可复现。更务实的提醒是:分类法再漂亮,若不能落到可复现的基准与共享的工件上,厂商的安全宣传依旧难以核对。把这篇和本周另一篇(护栏本身会被绕过,红队让对抗智能体 79% 概率跑出任意 Bash)并排看,结论一致——智能体安全的短板不在「有没有人测」,而在「测的是不是真危险的那些路径」。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。