为什么安全评测是智能体评测的短板
过去两年,本站持续跟踪了编码、长程任务、终端操作等维度的智能体横评,但一个维度始终值得单独拿出来量化审视:对抗环境下的表现。原因很朴素——智能体与聊天机器人的本质区别是「读外部数据 + 执行动作」,而这两件事叠加起来,恰好构成间接提示注入(indirect prompt injection)的完美温床:攻击指令藏在邮件正文、工单备注、PDF 附件里,模型把它当作指令执行。
直接注入发生在用户输入本身就是攻击载荷时;间接注入则发生在智能体履行本职工作、读取外部内容时。后者对智能体的威胁远高于前者,因为读不可信数据就是智能体的工作本身。
NIST 对这一风险的根因判断是:当前系统缺乏「可信内部指令」与「不可信外部数据」之间的清晰分离——这是模型层的结构性弱点,而非某个厂商的实现缺陷。既然短期内指令与数据无法在模型内彻底分离,防线就必须外移到智能体的权限设计上。
AgentDojo 框架拆解:动态环境与形式化效用
AgentDojo 由 ETH Zurich SpyLab 团队提出(NeurIPS 2024 数据集与基准轨道论文),是目前间接注入评测中被引用最多的动态框架,其设计有三个区别于静态基准的特征:
- 动态工具调用环境:智能体在有状态的环境中真实调用多个工具(收发邮件、查询银行流水、操作工作区文档),而不是对静态题目做一次性问答
- 形式化效用检查:攻击是否得手、任务是否完成,都以环境状态的计算结果判定,而非依赖另一个 LLM 模拟裁判——这避免了「裁判被注入」的元问题
- 可扩展攻防:框架支持持续加入新任务、新攻击与新防御,官方排行榜持续更新,静态基准「做一遍就过时」的问题被结构性缓解
论文发布时的基线数据勾勒了问题的轮廓:
| 口径 | 数值 | 含义 |
|---|---|---|
| 良性条件下任务完成率 | < 66% | 无攻击时,当时的主流 LLM 也有超过三分之一的任务完不成 |
| 注入攻击对表现最好智能体的成功率 | < 25% | 彼时已有攻击对头部智能体整体成功率有限 |
| 加入防御(二次攻击检测器)后 | ≈ 8% | 防御有效但依赖额外检测模型 |
这套「66 / 25 / 8」的三角关系(良性效用、裸攻击、带防御)构成了后续所有攻防研究对话的坐标系。环境覆盖工作区、差旅、银行、Slack 四类套件,合计 949 个测试用例(2026 年攻防论文使用的口径)。
NIST 实证:单次评估如何低估 23 个百分点
2025 年 1 月,NIST CAISI(美国国家标准与技术研究院人工智能安全与创新中心)发布技术博客,披露了在 AgentDojo 上对前沿模型做智能体劫持(agent hijacking)评估的两项关键发现。
发现一:重复尝试让成功率从 57% 涨到 80%
包括 AgentDojo 在内的多数评估框架,对每个攻击只测一次。但 LLM 输出是概率性的:同一个任务跑两遍,结果可能不同。NIST 团队取五个注入任务,把每个攻击重复尝试 25 次——平均攻击成功率从 57% 上升到 80%,且单个任务的波动幅度显著。
| 评估方式 | 平均攻击成功率 | 风险含义 |
|---|---|---|
| 单次尝试(行业常见口径) | 57% | 系统性乐观 |
| 每攻击重复 25 次 | 80% | 更接近攻击者可持续重试的真实风险 |
在攻击者可以低成本反复触发的现实场景(比如向客服智能体反复投递带毒邮件),单次评估给出的安全结论可能严重低估真实风险敞口。NIST 的建议很明确:只要重复攻击在应用场景中可行,评估就必须从单次走向多次。
发现二:新攻击把成功率从 11% 推到 81%
NIST 评估团队还做了攻击能力对比:在同一个前沿模型上,已知基线攻击中成功率最高的一个约 11%;而 NIST 团队新编写的攻击,成功率高达 81%。同一套攻击技术还迁移出了原始测试环境,包括模拟银行环境(BankInfoSecurity 行业研讨会对该迁移性的表述)。
这组数字的工程含义不在 81% 本身,而在11% 与 81% 之间 70 个百分点的落差完全由攻击方研究投入贡献——防御评估如果只测已知攻击,结论会随攻击方进步迅速过期。
NIST 的制度化动作
实证之外,NIST 在 2026 年把智能体安全推入标准化轨道:2026 年 1 月 12 日发布信息征集(RFI),将智能体风险归为三类(对抗数据交互、模型本身不安全、无对抗输入也会危害安全的模型);2026 年 2 月 17 日正式启动 AI Agent Standards Initiative。另据行业报道转述,CAISI 与 Gray Swan、UK AISI 及多家前沿实验室联合组织的大规模红队竞赛规模达到 25 万+ 次攻击尝试、400+ 名红队成员、13 个前沿模型,且每个目标模型都至少被成功攻破一次——该竞赛细节为报道转述口径,非 NIST 官网直接披露,采用时建议留意。
攻击演化:从 InjecAgent 到隐蔽注入
2026 年 8 月挂上 arXiv 的研究(编号 2608.30362)系统对比了四类注入攻击在 AgentDojo(n=949)上的表现,攻击谱系清晰可辨:
- Direct:把注入目标直接作为任务指令插入工具输出——最朴素,也最易被识别
- InjecAgent:把注入伪装成工具输出里的「系统通知」
- Important message:AgentDojo 官方基线中表现最好的攻击,把注入包装成用户的紧急留言
- ChatInject:操纵对话模板,在工具输出内部伪造 user/assistant 轮次边界——攻击面从内容层深入到模板层
- ICoA(隐蔽注入):该研究提出的方向,追求「用户永远不会知道」——注入执行后不在界面上留下可见痕迹
攻击演化趋势与 NIST 的 11%→81% 相互印证:攻击力增长来自伪装深度(内容伪装 → 模板伪造)与隐蔽性(可见 → 不可见),而非单纯的措辞优化。研究还发现一个对防御方略为利好的规律:当攻击目标异常敏感(例如让智能体转发认证码)时,攻击成功率显著下降——说明敏感操作边界本身具有防御价值。
防御矩阵:降攻击率也降效用
防御侧的量化图景来自两路研究。前一路是 2026 年发表的工具型智能体间接注入防御评估,在 AgentDojo 银行套件(288 题)上测了四类防御与无防御对照:
| 模型(未防御) | 攻击成功率 | 解读 |
|---|---|---|
| GPT-5.4 | 0 / 288 | 该配置下零得手 |
| GPT-5.4-mini | 11 / 288 | 约 3.8% |
| Claude Sonnet 4.6 | 1 / 288 | 约 0.3% |
必须原文照录该研究自身的警示:跨模型差异需要谨慎解读——各模型的基准目标并非同等可达,0/288 不等于「该模型免疫」。同时银行套件本身不代表全部环境(四套件中银行恰好是工具面较窄的一类)。
另一路证据来自防御手段的横向对比。在 GPT-5.4-mini 等配置上,主流防御呈现一致的模式——攻击率与良性效用同向下降:
| 防御手段 | 机制 | 观察到的代价 |
|---|---|---|
| Prompt Injection Detector | 外挂检测模型拦截可疑观察 | 良性效用下降(误拦) |
| Tool Filter | 限制可用动作集合 | 直接收缩可用动作空间 |
| Instruction Prevention | 提示词层训练模型拒绝注入指令 | 效果有限,依赖模型服从性 |
| Data Delimiters / Repeat User | 数据定界符 / 用户指令重复强调 | 实现简单,防御强度有限 |
| Task Shield | 任务边界防护 | 攻击率压至 1% 以下量级,代价取决于实现 |
该研究的统计结论同样值得转述:配对比较经 Holm 校正后均未达显著水平(仅 Tool Filter 未校正 p 值低于 0.05),且良性效用的跨次稳定性高于低频攻击结果。落到实践:评估防御时至少要同时报告攻击结果、目标可达性、良性效用、动作可用性与 run-to-run 波动五组指标,只报一个 ASR 数字的防御宣称不足为信。
Harness 层防御的新路线
2026 年 8 月底发表的 SkillGuard 研究(arXiv,2026-08-30 提交)代表了另一条路线:不再试图判断「内容是否可疑」,而是在 harness 层把「不可信数据进入上下文」本身视为污染事件,并据此收缩智能体后续能力。
- 机制:以技能影响图(Skill Impact Graph)表示安全相关状态转移,用可操控性签名约束技能参数,由内联引用监视器裁决每次调用;污染发生后计算加权能力收缩,切断从当前状态通往部署方定义的「禁止状态」的路径
- 成绩:在 AgentDojo 四套件、双后端模型(Gemini 2.5 Flash 与 Llama3.3-70B)上,三套件的攻击成功率清零,Slack 套件降至 4.8% 与 14.3%;对组合式攻击(多个单独无害的观察拼接成攻击)优于所有对照防御
- 代价:不引入任何额外模型调用或 token 开销——与「外挂检测模型」路线的成本结构形成鲜明对比
内容检测路线(PI Detector 等)在模型外判断「这句话像不像攻击」,注定是攻防军备竞赛的跟随方;能力收缩路线(SkillGuard、以及 NIST 倡导的权限最小化)承认「检测终会失手」,转而保证失手时的爆炸半径有限。两条路线不互斥,但预算紧张时后者更接近根本解。
给工程团队的六项检查清单
综合 NIST、AgentDojo 与上述研究的可操作结论,任何准备接入生产系统与真实凭证的智能体,都应先过以下六关(本站对行业建议的归纳,具体阈值需按业务自定):
- 独立身份与限时凭证:智能体不借用人类账号;凭证按任务最小范围授予并设定过期时间——被遗忘的试点项目不会因此长期持有生产密钥
- 正向授权优先于黑名单:只放行任务所需的少量动作,其余一律拒绝;否则智能体继承整个账号的全部可达面
- 后果性动作设人工闸门:删除记录、付款、改权限、发客户邮件、推生产代码,全部停下等人确认;闸门要窄,否则人会开始橡皮图章
- 重复攻击评估:按 NIST 实证,安全评估至少覆盖多次尝试口径,单次结论视为乐观下界
- 防御评估报告五指标:攻击结果、目标可达性、良性效用、动作可用性、波动幅度——缺项的防御宣称不予采信
- 敏感操作边界前置:把认证码转发、资金操作等高敏动作从智能体可达集合中物理移除,而不是依赖模型「拒绝」
局限与未解之题
- 基准外推性:AgentDojo 四套件覆盖邮件、银行、差旅、工作区,但真实企业环境(ERP、工单、代码库)的工具组合更复杂,基准成绩不能直接外推
- 模型更新即过期:攻防成绩强绑定具体模型版本,每次模型升级都需要重测;AgentDojo 的可扩展设计缓解但未消除该问题
- 竞赛数据口径:红队竞赛的 25 万+ 次尝试、13 模型全破等数字来自行业报道转述,官方一手报告细节尚未完整公开
- 防御的长期成本:能力收缩路线对业务灵活性的隐性代价(如合法跨域操作被拦截)尚缺长期量化数据
- NIST 标准落地节奏:自愿性指南与最佳实践的发布时间表、以及各国监管的对接方式,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态