工作区智能体(workspace agent)把大模型接上执行环境,能读写外部资源、跑多步任务,能力越强,出事的方式也越花。9 月底挂上 arXiv 的 EvoRiskBench(编号 2610.03153)就是冲着这类「运行时风险」来的:它不考 agent 答没答对题,而是考它在真实执行环境里,会不会沿着一条被诱导的路径,悄悄把不该碰的东西碰了。论文作者来自多家机构,提出了一个叫 EP-Path-EF 的框架,把风险拆成「入口」和「效应」两端,中间用 agent 介导的路径串起来。

EP-Path-EF:把风险路径显性化

过去不少安全基准把 agent 当聊天框,只盯着最终答案有没有被带偏;EvoRiskBench 反过来,把 agent 当成带状态、有工具、会留痕迹的软件来测。EP-Path-EF 定义了 9 类风险入口(比如外源内容、工具参数)和 5 类技术效应(被改变的工作区状态等),再用一条「agent 介导的风险路径」把两者连起来。它发的不是静态问答题,而是在隔离环境里真正构造并跑通对抗性任务,再用运行时轨迹与环境状态独立核验结果。这种「跑起来看后果」的思路,比单纯问「你会不会上当」更接近真实威胁。

9 类风险入口如外源内容/工具参数agent 介导风险路径EP-Path-EF5 类技术效应一条样本路径:外源内容投毒 → 经工具调用 → 悄悄改了工作区状态
图 1|EvoRiskBench 用 EP-Path-EF 把「风险入口」到「技术效应」的 agent 介导路径显性化,覆盖 9 类入口与 5 类效应

数字里藏着两个判断

论文在 6 个场景、450 个对抗任务上,测了 9 组「模型乘框架」组合,覆盖 GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5 三款模型,以及 Claude Code、Codex、OpenClaw 三种执行框架。结论有两处值得记下:一是攻击成功率最高冲到 68.4%(Codex 配上 DeepSeek-V4-Pro-0813 那组),说明即便是配置得当的工作区 agent,也远没到「能放心放手」的程度;二是差异更多来自模型而非框架——换模型比换框架更能改变安全表现。这对只想「换个更稳的框架」就以为安全的团队是个提醒:根子常在模型对风险入口的判断力上。

高Codex+DeepSeek 68.4Claude Opus 5 配置其余 7 组更低9 组配置里攻击成功率差异显著,且「模型间」差异大于「框架间」差异
图 2|9 组模型与框架组合下,最高攻击成功率达 68.4%,且配置比框架更决定安全与否

它和同类基准怎么区分

近一年 agent 安全基准不少,EvoRiskBench 的切口在于「运行时风险路径」和「会演化」。它和 RIFT-Bench(结构红队,专盯提示注入越过工具边界)、AgentLAB(长程多轮攻击炼狱)、ScopeBench(越界恪守)是不同切面:那些更偏「攻击能不能打穿」,EvoRiskBench 偏「打穿之后造成的状态后果能不能被系统捕捉」,并强调数据集会随模型与框架演进而持续更新。论文也留了克制:基准与评测平台会在完成安全性与可复现核查后再放出。对正在把 agent 接进真实系统的团队,这类基准的价值不是给你一个分数,而是给你一张「我的 agent 最容易从哪类入口失守」的地图。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

辩证地看,EvoRiskBench 也带有这类研究的共性局限:任务来自有限场景、攻击成功率高低受评测环境设定影响、不同框架的默认安全配置并不统一。但它把「风险路径」这个视角钉进了评测议程,本身就有增量价值。对开发者而言,比盯着总分更有用的是顺着 9 类入口自查——外源内容会不会流进文件、shell、网络工具,工具层有没有目的地与路径白名单。把护栏建在工具边界上,而不是寄托于模型「自觉」,才是这份研究真正想推动的工程习惯。对审计与安全团队来说,这类可复现的对抗任务,比厂商自报的「拦截率」更值得放进验收清单——前者能复跑,后者往往说不清口径。