给智能体做安全评测,今天大多还停留在「给一个提示、看一次回答、判成或败」的阶段。9 月 14 日提交到 arXiv 的基准 BLINDSPOT 想纠正这件事:它认为,对会长时间使用工具、跨多轮与真实环境打交道的智能体来说,单轮评测会系统性地漏掉最危险的失效——那些在前面几轮看起来都正常、到后面才冒出来的危险动作。
单轮评测的盲区
现有安全评测常把智能体行为压缩成单轮或二元的成功判据。这种方式有两个弱点:一是看不见「渐进失稳」,二是分不清一个智能体到底是「做完了且安全」「正确地拒绝了危险请求」,还是「做完了但偷偷干了危险动作」。
BLINDSPOT 的出发点正是:在带有持久状态、授权会随交互演化、还要面对外部反馈的真实部署里,一次性的安全检查根本覆盖不了完整的风险面。
BLINDSPOT 怎么做轨迹级评测
论文用「轨迹」而不是「单条提示」作为评测单元。它构建了超过 2500 条多轮交互轨迹,平均每条约 14.7 轮——这正贴近生产环境里越来越长的智能体会话。评测覆盖 13 个闭源与开源权重模型,用 8 项指标综合打分。
为贴近真实对抗,它采用自适应对抗交互、有状态的工具执行,以及基于执行结果的裁定,而不是摆一堆固定的攻击样本。内容上涵盖 22 个攻击族、35 个场景、7 个领域。
五类结果
每条轨迹会被分到五类结果之一:
- Safe Completion:安全完成,既达成目标又全程合规;
- Correct Refusal:正确拒绝,对危险请求说了不;
- Unsafe Completion:不安全完成,任务做完了却出了危险动作;
- Over-Refusal:过度拒绝,把正常请求也拦了下来;
- Indeterminate:无法判定,信息不足以归类。
这个分类的用意是把「安全」与「效用」的张力显形:一个什么都拒的绝对安全却没用,一个什么都不拒的有用却危险。
关键发现:危险在后面几轮才出现
论文在 13 个模型上的初步结果显示,安全与效用的校准差异很大;更值得警惕的是,失效往往只在若干起初安全的步骤之后才出现。一个智能体可能在早期安全检查里一路过关,却在序列后段执行了不该执行的动作。这直接挑战了「单轮对齐能自然迁移到多轮智能体」的假设。
论文据此主张:应把智能体安全当成「轨迹级属性」来对待,而不是单轮或二元的成功判据。换句话说,评测要看完整的一整段交互,而不是其中任一帧。
对评测实践的启示
对正在做智能体评测的团队,BLINDSPOT 给出一个可操作的提醒:如果你的红队或回归测试还是「单轮问答 + 通过率」,那它很可能测的是「会答题」,而不是「会在长任务里守住边界」。要把评测口径跟着任务长度一起拉长,用轨迹级的成功、拒绝、越界、过度拒绝多维度去刻画,才可能接近真实风险。
这也呼应了近期多起真实事件中观察到的现象:问题很少在一开始就爆发,而常在长跑途中慢慢显现。评测若只看起点和终点,中间的失稳就会被平均掉。