智能体框架越来越多,安全审计也得跟上节奏。9 月 25 日挂上 arXiv 的 AgentXploit(编号 2609.31318)做了一件让人后背发凉的事:它读一个开源 agent 项目的源码,自己提出攻击路径,再对着一份跑起来的副本真刀真枪地试。论文作者来自新加坡国立大学、UNC Chapel Hill、UC Berkeley、芝加哥大学、UC Santa Barbara 等多家机构,他们想回答的是一个很实际的问题——给定一个已知漏洞的细节被藏起来,一个系统能不能自己把它重新发现并利用。
分析者与利用者,各管一段
AgentXploit 拆成两个角色。分析者 agent 负责测绘仓库:它维护一个调查队列,用搜索、依赖、符号、AST、LSP 等工具,把「外部输入到敏感操作」的路径追出来,产出的候选攻击路径带着代码证据,本质是假设。利用者 agent 只通过攻击接口去打一个隔离目标,每试一次都看到自己上次的载荷、目标的响应、被允许的执痕,再据此修正。对于提示注入类任务,它从一个精选种子库起手,把协同指令撒到多个注入点。关键的操守是:判定有没有真的造成危害,交给一个外部确定性校验器,而不是让 agent 自己说了算。
确定性校验器决定了可信度
值得补充的是,AgentXploit 用外部确定性校验器来判定是否得手,而不是让 agent 自己评估——这一个设计选择,直接决定了结论能不能信。红队自动化最危险的不是攻击成功,而是把假阳性当战果、把真漏洞漏过去。让可验证的判据说了算,才让它从演示玩具变成能接进持续集成、定期跑的审计组件。对框架维护者,这份基准列的几类弱点就是自家该先补的清单。
数字与边界
在 72 个实例的基准上(这些实例来自 2023–2025 年公开披露的 CVE 和 agent 安全议题,经 NVD 核对、并在可运行环境里验证过),AgentXploit 端到端成功率 59.3%,而用了同一个 gpt-5.1-codex 模型的 Codex CLI 基线只有 38.4%。这 72 个实例横跨 12 个开源项目,其中 OpenClaw 占了 10 例,LangChain、LobeChat 各 8 例,AutoGPT、MetaGPT 等也在列。在 AgentDojo 上,利用者 agent 更是达到 79.2%,明显高于对照方法。论文也老实写了局限:GPT_Academic 一个项目就占了近三成实例,精度并不算高,且不能完全排除主干模型见过这些公开 CVE 带来的污染;payload 文本按负责任披露流程做了保留,没有随文放出。
差距藏在「间接路径」上
最该被工程侧记住的,是间接路径上的差距比直接路径更大——也就是说,agent 介导的、绕弯的那类攻击,恰恰是自动化红队帮得上忙的地方。这和我们一直警惕的间接提示注入是同一个战场:不可信的检索内容会悄悄摸到文件、shell、网络工具,靠在提示词里写规则拦不住,得在工具层做目的地和路径白名单。有意思的是,OpenClaw 这种被本站长期追踪的开源框架,本身也成了基准的受试对象——这既是压力测试,也是生态成熟的标志:能被严肃地审计,才能被认真地用在生产里。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
AgentXploit 给所有开源 agent 框架维护者提了个醒:能审计你的,已经可以是另一个 agent。把 2023 到 2025 的 CVE 先在自己跑着的框架上补干净,比等一次红队演示来得划算。