评测单轮大模型,业界已经有不少成熟的基准;但智能体一旦跑起多步任务,行为会沿着长链路慢慢「漂移」,这类失准却少有人系统测。Aegis AI 推出的 agentic-redteam-benchmark 正是冲着这个缺口来的:它包含 2288 条多步轨迹,覆盖五类失准模式,并提出「在漂移实际发生的那一步命中才算抓对」的修正指标,进而对比通用大模型裁判与专用轻量验证器的差距。它想解决的,不是「模型聪不聪明」,而是「模型跑偏时,我们能不能及时、准确地发现」。
失准往往不在首句,而在第六步
单轮问答里,答错一眼可见;多步智能体里,失准常常藏在链路中段。一个智能体会读文件、调工具、按上一步结果决定下一步,越往后越依赖前面累积的状态。问题就出在这里:它可能在第 6 步读错了文件、第 8 步被一段注入带偏、第 11 步悄悄绕过了某项限制——首句提示词完全正常,失稳却已经在中间某步发生。传统「给一个问题看答案」的基准,对这种长链路漂移几乎失明。
agentic-redteam-benchmark 把失准归纳为五类模式:工具滥用(tool_call_abuse,让智能体调用了不该调用的接口)、目标漂移(goal_shift,执行中偏离了原始指令)、智能体胁迫(agent_coercion,被外部输入诱导做出越权动作)、能力洗白(把不具备的能力伪装成具备)、计划偏离(执行的步骤顺序偏离既定方案)。2288 条轨迹就是按这些模式构造与标注的,专门逼智能体在长链路里露出马脚。
增量认知:评测智能体,难点不在「它会不会答」,而在「它跑着跑着会不会变」。单轮基准看的是瞬间正确率,agentic 基准看的是全程守规矩的概率。把失准拆成「工具、目标、胁迫、能力、计划」五类,等于给了红队一张可操作的检查清单——以后测一个智能体,不再只问「答得对吗」,而是逐类问「它有没有滥用工具、有没有漂移目标、有没有被胁迫」。
指标纠偏:提前误报不算抓对
怎么算「抓到了失准」?朴素做法很简单:只要相关步骤附近出现了匹配信号,就记一次命中。但这类宽松判定的代价是误报极高——Aegis AI 指出,朴素余弦相似度方法的误报率高达 97,意味着绝大多数「命中」其实是假警,基准分数被严重注水,看着漂亮却不可信。
agentic-redteam-benchmark 改用更严格的修正指标:验证器必须在「漂移实际发生的那一步」命中,才算真正抓对;提前命中(在错误发生前就报警)或错步命中(落在无关步骤),都算假警。这个定义把「早发现」和「乱报警」切割开:好的验证器应当精准定位失稳发生的那一刻,而不是在全程撒网。
在这个更严的尺度下,两类裁判拉开差距:以 GPT-4o-mini 作通用裁判,F1 仅为 0.672;而专用验证器 Ring12 达到 0.843,且成本约只有前者的二百分之一,误报率从 97 骤降到 1.1。也就是说,一个为任务定制的轻量验证器,在准确率与成本上同时胜过通用大模型裁判——这对「评测就得上大模型」的惯性是一个提醒:在结构化判定上,小而专往往比大而全更划算。
对红队评测的三点启示
这套基准给做智能体安全评测的人三点实在启示。其一,评测必须看长链路而非单轮,失准大多发生在过程里,不在起点上;只测首轮响应,会系统性低估风险。其二,专用轻量验证器值得投入:在「是否抓对了漂移步」这种结构化判定上,定制小模型在准确率与成本上可以双杀通用裁判,不必逢评必上大模型。其三,指标定义决定你能不能相信基准——一个放任误报的指标,产出的高分只是幻觉;先定清「什么叫抓对」,再谈分数。
边界提醒:基准本身也需要被评估,而不是被供奉。2288 条轨迹的规模仍有限,验证器 Ring12 的高分也可能部分来自对本基准分布的过拟合;它证明的是「专用验证器路线可行」,而非「某模型已经安全」。引用这些数字时,应区分「方法上的进步」与「对真实部署的保证」,后者还需要在更杂、更大的轨迹集上反复验证。
agentic-redteam-benchmark 的意义,在于把智能体评测从「答得对不对」推进到「跑偏了能不能及时发现」。当智能体越来越多地自主调用工具、执行多步任务,能否在漂移发生的那一步精准叫停,会比单次回答的漂亮程度更关乎安全。Aegis AI 这一步不一定完美,但它把问题摆到了对的位置。