一句话:单轮攻不破的防御,在多轮长程攻击面前可能形同虚设

ICML 2026 收录的 AgentLAB 把智能体安全评测推进到一个少有人系统测量的角落:长程、多轮、人和智能体与环境连续交互时才会暴露的攻击面。它给出的是一组明确的数字——五种攻击类型、二十八个真实感的环境、六百四十四个安全测试用例。结论并不乐观:今天为单轮对话设计的防御,几乎无法可靠地挡住需要跨多步才能完成的攻击。对已经把智能体接进业务系统的团队来说,这是一个绕不开的提醒——你们测过的「安全」,可能只覆盖了威胁的一小部分。

攻击不再只发生在单轮,而是沿多步交互慢慢逼近 智能体长程任务 意图劫持 工具链攻击 任务注入 目标漂移 记忆投毒 共 5 类 评测规模:28 个环境 × 644 个安全用例
图 1|AgentLAB 的五类攻击围绕智能体展开,关键不在单点突破,而在多步累积。

它测的五种攻击,名字背后是五种「套路」

论文把长程攻击拆成五类,命名都很直白。意图劫持是让智能体在某个中间步骤悄悄把目标换成攻击者想要的结果;工具链攻击把危险动作藏在一串连续工具调用里,单看每一步都合理,合起来却越界;任务注入是在环境信息中埋入指令,等智能体读到后照做;目标漂移让智能体在执行中逐渐偏離原定目标而不被察觉;记忆投毒则污染智能体跨轮次保留的长期记忆,使后续所有决策都建立在被篡改的前提下。这五类有一个共同点:它们都需要时间——需要智能体先走几步、积累一些状态,攻击才真正生效。这正是单轮防御看不到的盲区。

为什么为单轮设计的防御会失灵

今天大多安全护栏,本质是在「一句话进、一句话出」的设定下训练的:过滤明显恶意的提示、拦截已知的越权指令、对输出做合规检查。但长程攻击把恶意拆散到很多步里,每一步单独看都无害,甚至还很正常。等到智能体积累出足够的中间状态,危险动作才浮出水面——而那时护栏早已不在「检查窗口」里。AgentLAB 的核心贡献,正是把评测从「一次对话能不能被骗」升级成「一连串交互里会不会被慢慢带偏」。它给社区一个可复用的基准,让不同智能体的长程鲁棒性终于能放在同一把尺子上比。

防御的「检查窗口」和攻击的「生效时刻」错开了 单轮防御假设 第 1 步过滤恶意第 1 步查越权检查窗口在第 1 步适合:一次性请求 长程攻击现实 第 1-4 步都正常第 5 步才越界护栏已不在窗口内危险在累积后才生效
图 2|单轮防御把检查压在第 1 步,长程攻击却把危险留到第 5 步才暴露。

它和已有的安全评测不是一回事

最近半年智能体安全评测集中出现,但各自的刀法不同。RIFT-Bench 偏「结构红队」,先把一个智能体系统解析成节点与连接,再针对工具、记忆、路由、执行路径发起适配性攻击;ScopeBench 给模型加了第二把尺子——不仅看攻击能力,还看「越界恪守」,也就是模型在被告知范围后能否管住自己;LIMBO 关注的是智能体「自报完成」的可靠度,能否真的验证自己干完了活。AgentLAB 的独特点是把「长程、多轮、跨状态」作为主战场,专门测量那些单轮评测永远测不到的威胁。四者合起来,才勉强拼出智能体安全的全貌:既要测能力,也要测恪守,还要测跨多步的韧性。

对做产品的团队,这意味着什么

一个直接的工程启示是:护栏不能只长在输入端。如果你们的智能体要跑长任务、调多个工具、保留跨轮记忆,那么防御也得跟着变成「有状态」的——要能监控多步轨迹里目标有没有悄悄偏移、记忆有没有被污染、工具调用链有没有越界。换句话说,安全评测要从「审一句话」升级成「审一整条轨迹」,最好还能回放。AgentLAB 这类基准的价值,就是让「长程鲁棒性」从一个模糊的担忧,变成可以反复测、横向比的指标。

边界:样本有范围,但方向站得住

需要如实说明:AgentLAB 的二十八个环境是它挑选出来的真实感场景,六百四十四个用例也由其构建,是否覆盖你所在行业的特有流程,仍需自己补测。它没有给出一套开箱即用的防御方案,这是基准类工作的常态。但把问题「命名并量化」本身就是进展——一旦业界承认长程多轮是独立威胁面,评测、日志与恢复机制才会朝「可验证轨迹」真正补位。

结语

智能体越能自主地跑长任务,单轮安全幻觉就越危险。AgentLAB 提醒我们:别用「一句话测不穿」来给自己安全感,真正该盯的,是那条跨了很多步的轨迹,是否已经悄悄偏了方向。