当企业里的智能体从几个涨到成千上万个,靠人手工去红队、去测每个 agent 的安全和策略合规,显然跟不上。更麻烦的是,攻击者自己也在用 agent——他们发起的是能跨轮次、会学习变招的持久多轮攻击,而大多数红队工具还停留在「拿一串静态攻击提示去比模式」的阶段。10 月 7 日,做智能体信任基建的 Vijil 发布 Diamond Adaptive Red Teaming(DART),想用「以 agent 打 agent」的思路翻这个篇。

让一群对抗 agent 自己学、自己变招

DART 的核心,是用多个对抗 agent 去探测目标的防御,而且这些攻击是「自适应」的:它们跨轮次、跨片段、跨交锋去学习,并针对目标 agent 调整战术。现有红队工具大多只拿固定脚本去匹配已知攻击模式,测的是模型和聊窗那一层;DART 测的是整个 agent——它的工具调用、它的记忆、它的多轮行为,而且攻击会适应当前环境,不需要你事先告诉它「去找哪种漏洞」,它自己就能找到。等于把红队从「按清单打勾」变成「对手在演戏」。

DART:用一群对抗 agent 红队你的智能体自适应对抗 agent跨轮次学变招测整个 agent工具加记忆加多轮进 CI/CD自动跑带限速可在客户自有 VPC、本地、气隙环境里跑
图 1|DART 用多个会学习变招的对抗 agent 去打目标:测的是整个 agent(工具调用、记忆、多轮行为),能嵌进 CI/CD 自动跑,且可部署在客户自有 VPC 或气隙环境

能进 CI/CD,也能跑在气隙里

落到工程上,DART 给的能力挺全:风险覆盖可定制,自带基于 OWASP、MITRE 和 Vijil 自有研究的分类目录,也能从企业自己的风险目录派生;自适应攻击链把跨轮次的攻击串起来探索目标的攻击面。它做了 Claude Code 与 Codex 的插件,能和任意 agent 框架或部署平台配合,产出工程与合规都能用的可审计报告;还能在 DevOps 的 CI/CD 里自动跑,带限速、重试、按角色配模型。部署上灵活:客户的自有 VPC、完全本地、乃至气隙与受监管环境都能跑。

实测口径攻击成功率比对手高 1.5 倍12 类企业任务胜 9 类2028 均用 15 万 agentGartner 预测财富五百强 2028 年平均超 15 万 agent2025 不到 15 个
图 2|DART 在 DecodingTrust-Agent 上攻击成功率比最接近对手高 1.5 倍、12 类企业任务胜出 9 类;Gartner 估财富五百强 2028 年平均用超 15 万 agent,红队需求随之陡增

数字亮眼,但要会读

Vijil 给的实测口径是:在 DecodingTrust-Agent 基准上,DART 的攻击成功率比最接近的对手高 1.5 倍,在 12 类企业 agent 任务里胜出 9 类。它还搬出 Gartner 的预测——财富五百强到 2028 年平均会用超过 15 万个 agent,而 2025 年还不到 15 个,红队需求的陡峭程度可想而知。DART 是 Vijil Diamond 的新能力,配套还有根因分析、按策略生成护栏、给出代码修复建议等模块,形成「发现弱点、补护栏、改代码」的闭环。

辩证看:自适应也意味着更难预测漏了什么

该泼的冷水得泼。1.5 倍这个倍数是厂商在自己基准上的数字,跨到客户真实环境未必同倍;「自适应」在变招的同时,也意味着你更难预测它到底漏掉了哪类攻击——它找到的,不代表它覆盖了全部。更务实的判断是:方向是对的,手工红队确实跟不上 agent 数量的指数级增长,用 agent 打 agent 是大势所趋;但企业别把它当成「买了就安全」,它该是持续集成里的一道常态检查,而不是上线前几天的突击。

和本站智能体安全基建的其它稿拼起来

把 DART 放回近期智能体安全基建里:本批另一篇写了 Anaconda 的平台(群协调加运行时护栏加红队),更早本站覆盖过腾讯 AI-Infra-Guard(对整条 AI 栈做开源红队扫描,含 agent、技能、MCP 与模型)。三者的差异化很清楚:AI-Infra-Guard 是「扫描全栈的漏洞面」,Anaconda 是「把红队与护栏做成开发者平台的默认层」,DART 则是「用会学习变招的对抗 agent 去打你的 agent」。Vijil 这版的锋利处,正在于它把红队本身也 agent 化、自适应化。对安全团队来说,提醒是:当攻击方已经在用多轮自适应 agent,你的红队如果还停在静态提示,就等于拿清单去防一个会即兴发挥的对手。

DART 押的注很清楚:agent 数量的爆炸,会把红队从「偶尔请人测一次」逼成「每个 agent 进 CI/CD 就自动被打一遍」。当对手也在用 agent,用 agent 打 agent 不再是一种炫技,而是维持安全的下限。