一句话:那个你天天引用的「攻击成功率」,可能根本没法跨论文比

arXiv:2609.25173 的标题就够扎心——《Attack Success Rate Is Not a Number》。作者 Chetan Pathade、Prathamesh Pawar、Shubham Patil 对 2025 年 2 月到 2026 年 9 月挂在 arXiv 上的 259 篇智能体安全论文做了全文元分析,结论是:攻击成功率(ASR)从来就不是一个单一量,而是一族由六个设计选择参数化的指标,而论文们几乎从不固定这六个旋钮,也几乎从不说明自己转了哪些。于是两个数字相减,减出来的往往是「测量方式」的差距,而不是「防御」的差距。

为什么值得看:安全论文的 headline 数字正在被裸用

智能体安全方向几乎每篇评估攻击与防御的论文,都把 ASR 当成头号指标。但作者指出,这个数字隐瞒了太多前提。他们做了两件事来佐证。其一,一份对 50 篇论文的手工随机抽样的元分析显示,58%(95% 区间 44 到 71)没有报告方差或重复运行;对全部 259 篇的自动编码则得到 65.3%。只有 30.9% 披露了足够的解码细节、能判断评估到底有没有随机性;在确认用了 LLM 裁判的 64 篇里,仅 29.7% 做了与人工标注的一致性检验。其二,一个解析研究说明这些省略不是小事:在 100 条样本的基准上,常规统计功效下能测出的最小 ASR 差距是 18.2 个百分点,而两个真实 ASR 只差 5 个点的防御,单次评估把它排错顺序的概率约 21%。

ASR 不是一个数字,而是一族六个旋钮 A1 单元尝试/任务/轨迹分母不同数字变 A2 裁判字符串/LLM/状态/人工口径变 A3 试验轮数/温度/种子随机性抖动 A4 适应静态模板/预算内自适应反转④ A5 知情不知/知道/握提示强弱差反转④ A6 二值半完成/重试如何计反转④
图 1|两个数字相减,减出的常是测量方式的差

机制拆解:六个旋钮,四个能动摇排名

论文把 ASR 拆成六个设计轴。A1 是分析单元——按注入尝试、按任务、还是按轨迹做分母;A2 是成功裁判——字符串匹配、LLM 裁判、环境状态还是人工裁定;A3 是试验与非确定性——每配置的轮数、温度、top-p、随机种子;A4 是攻击者适应性——用静态模板集,还是在查询预算下自适应;A5 是攻击者对防御的知情度——不知防御存在、知道有防御、还是握有其提示词或分类器;A6 是部分成功的二值化——半完成或被拒后重试的轨迹如何计分。六轴都会移动 ASR,其中四个会被系统级地反转排名。换句话说,两个用不同旋钮得出的数字,其实是两种不同量,相减得到的是描述测量而非防御的缺口。

被测得出的最小差距,远大于真实防御差 统计噪声最小可测差 18.2pp真实差仅 5pp排错序≈21% 报告缺口58% 无方差报告30.9% 披露解码65.3% 全样本 裁判可信64 篇用 LLM 裁判仅 29.7% 验证一致性检验 结论:先 recover 六个旋钮,再谈跨论文比较;清单不否定单篇,只补一份共享测量契约
图 2|小差距的胜负,大多是噪声而非防御

实验读数:小差距的排名,大多是噪声

这套框架实用的贡献,是一个十项报告清单,逐项对着它测出的每个失败点。它并不否定任何单篇结果,而是给整个领域补齐一份缺失的「共享测量契约」:跨论文比较 ASR 之前,先把六个旋钮 recover 出来。作者也诚实标注了自身的两处边界——语料级的 65.3% 来自自动编码、应读作与抽样结果一致的自动化估计而非独立确认;排名反转的结果则来自解析推导,「我们没有给出经验性的排名反转实验,那一步是自然的下一步」。这种克制反而让结论更可信。

优势与局限:契约已立,但落地靠自觉

它的价值在于把「评测有效性」这个常被忽略的环节,从脚注抬到了台面:防御声明之前,先问测量是否成立。局限也现实——清单再好,仍靠作者自愿填写,而投稿压力往往鼓励报一个大数字而非报齐六个旋钮。关于主流基准能否借统一环境把单元、任务集、裁判、轮数锁死、从而让同跑内的比较成立,论文认可是另一条路,但并未声称解决了跨跑问题。关于六轴之外是否还有未被点名的混淆因素,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。它给的方向很清楚:先有能比的尺,才有能信的胜负。

结语

「攻击成功率不是一个数字」这句话,戳中的是智能体安全研究里一处集体盲区。当 259 篇论文用着各自的尺,所谓「某防御把 ASR 从 X 降到 Y」,很可能只是在比两种测量。补齐这份契约,比再跑一轮对抗实验更紧迫——因为没有被正确测量的进步,连是不是进步都说不清。