能力评测 2026-09-24 30 分钟阅读 专家

智能体安全评测横评:AgentDojo 与 NIST 实证揭示的单次评估陷阱

从 11% 到 81%,从 57% 到 80% — 间接提示注入的攻防量化账本,以及防御层「降攻击率也降效用」的权衡真相

摘要

智能体要读邮件、查工单、翻文档——而攻击指令恰好就藏在这些不可信数据里。本文以 ETH Zurich 的 AgentDojo 基准为坐标,交叉 NIST CAISI 的官方实证与 2026 年多篇攻防研究,量化拆解三件事:其一,单次尝试评估如何把风险低估 23 个百分点(57%→80%);其二,新一代隐蔽注入攻击如何将成功率从基线 11% 推高到 81%;其三,五类主流防御在「压攻击率」与「保良性效用」之间的量化权衡。结论指向同一个工程原则:防线要建在权限层,而不是提示词层。

为什么安全评测是智能体评测的短板

过去两年,本站持续跟踪了编码、长程任务、终端操作等维度的智能体横评,但一个维度始终值得单独拿出来量化审视:对抗环境下的表现。原因很朴素——智能体与聊天机器人的本质区别是「读外部数据 + 执行动作」,而这两件事叠加起来,恰好构成间接提示注入(indirect prompt injection)的完美温床:攻击指令藏在邮件正文、工单备注、PDF 附件里,模型把它当作指令执行。

直接注入发生在用户输入本身就是攻击载荷时;间接注入则发生在智能体履行本职工作、读取外部内容时。后者对智能体的威胁远高于前者,因为读不可信数据就是智能体的工作本身。

🎯 根因判断(NIST 口径)

NIST 对这一风险的根因判断是:当前系统缺乏「可信内部指令」与「不可信外部数据」之间的清晰分离——这是模型层的结构性弱点,而非某个厂商的实现缺陷。既然短期内指令与数据无法在模型内彻底分离,防线就必须外移到智能体的权限设计上。

AgentDojo 框架拆解:动态环境与形式化效用

AgentDojo 由 ETH Zurich SpyLab 团队提出(NeurIPS 2024 数据集与基准轨道论文),是目前间接注入评测中被引用最多的动态框架,其设计有三个区别于静态基准的特征:

  1. 动态工具调用环境:智能体在有状态的环境中真实调用多个工具(收发邮件、查询银行流水、操作工作区文档),而不是对静态题目做一次性问答
  2. 形式化效用检查:攻击是否得手、任务是否完成,都以环境状态的计算结果判定,而非依赖另一个 LLM 模拟裁判——这避免了「裁判被注入」的元问题
  3. 可扩展攻防:框架支持持续加入新任务、新攻击与新防御,官方排行榜持续更新,静态基准「做一遍就过时」的问题被结构性缓解

论文发布时的基线数据勾勒了问题的轮廓:

口径 数值 含义
良性条件下任务完成率 < 66% 无攻击时,当时的主流 LLM 也有超过三分之一的任务完不成
注入攻击对表现最好智能体的成功率 < 25% 彼时已有攻击对头部智能体整体成功率有限
加入防御(二次攻击检测器)后 ≈ 8% 防御有效但依赖额外检测模型

这套「66 / 25 / 8」的三角关系(良性效用、裸攻击、带防御)构成了后续所有攻防研究对话的坐标系。环境覆盖工作区、差旅、银行、Slack 四类套件,合计 949 个测试用例(2026 年攻防论文使用的口径)。

NIST 实证:单次评估如何低估 23 个百分点

2025 年 1 月,NIST CAISI(美国国家标准与技术研究院人工智能安全与创新中心)发布技术博客,披露了在 AgentDojo 上对前沿模型做智能体劫持(agent hijacking)评估的两项关键发现。

发现一:重复尝试让成功率从 57% 涨到 80%

包括 AgentDojo 在内的多数评估框架,对每个攻击只测一次。但 LLM 输出是概率性的:同一个任务跑两遍,结果可能不同。NIST 团队取五个注入任务,把每个攻击重复尝试 25 次——平均攻击成功率从 57% 上升到 80%,且单个任务的波动幅度显著。

评估方式 平均攻击成功率 风险含义
单次尝试(行业常见口径) 57% 系统性乐观
每攻击重复 25 次 80% 更接近攻击者可持续重试的真实风险
⚠️ 23 个百分点的差距意味着什么

在攻击者可以低成本反复触发的现实场景(比如向客服智能体反复投递带毒邮件),单次评估给出的安全结论可能严重低估真实风险敞口。NIST 的建议很明确:只要重复攻击在应用场景中可行,评估就必须从单次走向多次。

发现二:新攻击把成功率从 11% 推到 81%

NIST 评估团队还做了攻击能力对比:在同一个前沿模型上,已知基线攻击中成功率最高的一个约 11%;而 NIST 团队新编写的攻击,成功率高达 81%。同一套攻击技术还迁移出了原始测试环境,包括模拟银行环境(BankInfoSecurity 行业研讨会对该迁移性的表述)。

这组数字的工程含义不在 81% 本身,而在11% 与 81% 之间 70 个百分点的落差完全由攻击方研究投入贡献——防御评估如果只测已知攻击,结论会随攻击方进步迅速过期。

NIST 的制度化动作

实证之外,NIST 在 2026 年把智能体安全推入标准化轨道:2026 年 1 月 12 日发布信息征集(RFI),将智能体风险归为三类(对抗数据交互、模型本身不安全、无对抗输入也会危害安全的模型);2026 年 2 月 17 日正式启动 AI Agent Standards Initiative。另据行业报道转述,CAISI 与 Gray Swan、UK AISI 及多家前沿实验室联合组织的大规模红队竞赛规模达到 25 万+ 次攻击尝试、400+ 名红队成员、13 个前沿模型,且每个目标模型都至少被成功攻破一次——该竞赛细节为报道转述口径,非 NIST 官网直接披露,采用时建议留意。

攻击演化:从 InjecAgent 到隐蔽注入

2026 年 8 月挂上 arXiv 的研究(编号 2608.30362)系统对比了四类注入攻击在 AgentDojo(n=949)上的表现,攻击谱系清晰可辨:

攻击演化趋势与 NIST 的 11%→81% 相互印证:攻击力增长来自伪装深度(内容伪装 → 模板伪造)与隐蔽性(可见 → 不可见),而非单纯的措辞优化。研究还发现一个对防御方略为利好的规律:当攻击目标异常敏感(例如让智能体转发认证码)时,攻击成功率显著下降——说明敏感操作边界本身具有防御价值。

防御矩阵:降攻击率也降效用

防御侧的量化图景来自两路研究。前一路是 2026 年发表的工具型智能体间接注入防御评估,在 AgentDojo 银行套件(288 题)上测了四类防御与无防御对照:

模型(未防御) 攻击成功率 解读
GPT-5.4 0 / 288 该配置下零得手
GPT-5.4-mini 11 / 288 约 3.8%
Claude Sonnet 4.6 1 / 288 约 0.3%

必须原文照录该研究自身的警示:跨模型差异需要谨慎解读——各模型的基准目标并非同等可达,0/288 不等于「该模型免疫」。同时银行套件本身不代表全部环境(四套件中银行恰好是工具面较窄的一类)。

另一路证据来自防御手段的横向对比。在 GPT-5.4-mini 等配置上,主流防御呈现一致的模式——攻击率与良性效用同向下降:

防御手段 机制 观察到的代价
Prompt Injection Detector 外挂检测模型拦截可疑观察 良性效用下降(误拦)
Tool Filter 限制可用动作集合 直接收缩可用动作空间
Instruction Prevention 提示词层训练模型拒绝注入指令 效果有限,依赖模型服从性
Data Delimiters / Repeat User 数据定界符 / 用户指令重复强调 实现简单,防御强度有限
Task Shield 任务边界防护 攻击率压至 1% 以下量级,代价取决于实现

该研究的统计结论同样值得转述:配对比较经 Holm 校正后均未达显著水平(仅 Tool Filter 未校正 p 值低于 0.05),且良性效用的跨次稳定性高于低频攻击结果。落到实践:评估防御时至少要同时报告攻击结果、目标可达性、良性效用、动作可用性与 run-to-run 波动五组指标,只报一个 ASR 数字的防御宣称不足为信。

Harness 层防御的新路线

2026 年 8 月底发表的 SkillGuard 研究(arXiv,2026-08-30 提交)代表了另一条路线:不再试图判断「内容是否可疑」,而是在 harness 层把「不可信数据进入上下文」本身视为污染事件,并据此收缩智能体后续能力。

🛡️ 两条路线的分野

内容检测路线(PI Detector 等)在模型外判断「这句话像不像攻击」,注定是攻防军备竞赛的跟随方;能力收缩路线(SkillGuard、以及 NIST 倡导的权限最小化)承认「检测终会失手」,转而保证失手时的爆炸半径有限。两条路线不互斥,但预算紧张时后者更接近根本解。

给工程团队的六项检查清单

综合 NIST、AgentDojo 与上述研究的可操作结论,任何准备接入生产系统与真实凭证的智能体,都应先过以下六关(本站对行业建议的归纳,具体阈值需按业务自定):

  1. 独立身份与限时凭证:智能体不借用人类账号;凭证按任务最小范围授予并设定过期时间——被遗忘的试点项目不会因此长期持有生产密钥
  2. 正向授权优先于黑名单:只放行任务所需的少量动作,其余一律拒绝;否则智能体继承整个账号的全部可达面
  3. 后果性动作设人工闸门:删除记录、付款、改权限、发客户邮件、推生产代码,全部停下等人确认;闸门要窄,否则人会开始橡皮图章
  4. 重复攻击评估:按 NIST 实证,安全评估至少覆盖多次尝试口径,单次结论视为乐观下界
  5. 防御评估报告五指标:攻击结果、目标可达性、良性效用、动作可用性、波动幅度——缺项的防御宣称不予采信
  6. 敏感操作边界前置:把认证码转发、资金操作等高敏动作从智能体可达集合中物理移除,而不是依赖模型「拒绝」

局限与未解之题

核心发现

参考来源

  1. NIST 官方技术博客 — Strengthening AI Agent Hijacking Evaluations(nist.gov,2025.01,57%→80% 与 11%/81% 实证及方法论)
  2. AgentDojo 论文(NeurIPS 2024 Datasets & Benchmarks Track,ETH Zurich SpyLab)— 动态评测环境设计与 66/25/8 基线;官方排行榜 agentdojo.spylab.ai
  3. arXiv 2608.30362 — Will the User Ever Know? Covert Indirect Prompt Injection Attacks on Tool-Using LLM Agents(2026.08,攻击与防御 n=949 对比)
  4. Evaluating Indirect Prompt Injection Defenses in Tool-Using LLM Agents(2026,银行套件 288 题防御-效用评估与统计警示)
  5. SkillGuard 研究(arXiv 2026.08.30)— Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection
  6. The Automators / BankInfoSecurity / AI 博士万戈 — NIST 评估与红队竞赛的行业转述与工程化解读(竞赛细节为转述口径)