红队测试本来是安全公司的活儿,要配 API 密钥、要云、要预算。T3MP3ST(读作 TEMPEST)这个开源框架反其道而行:它不训练自己的模型,也不申请额外密钥,而是把你本地已经登录运行的编码智能体——Claude Code、Codex、Hermes,或者 Ollama / LM Studio 自托管的模型——直接变成一支自主红队作战单元。它本质上是一层多智能体调度,把「侦察→利用→报告」的攻击链编排起来。
它的「无密钥作战」设计是精髓:直接复用你已有的编码 agent 会话,不需要独立提供商密钥;出口范围控制确保联网工具自动拒绝触碰范围外的公共主机。框架用 Web 端「作战室」界面或 CLI 把目标指给本地 agent,后者就成了任务中枢。八类算子(侦察、扫描、利用、渗透、外传、幽灵、协调、分析)一一映射到 MITRE ATT and CK 战术与杀伤链;中央指挥单元以每秒一次的节拍驱动整个循环。基准成绩算亮眼:在 XBOW 的 104 项 XBEN 挑战里拿到 90.1% 的 pass@1(该黑盒基准自报成绩约 85%),每个解法都经提交标志验证;在 40 项任务的 Cybench 学术基准上,单 agent 的 ReAct 循环无提示破解了 23 项;更值得注意的是一组 2026 年披露的 10 个真实 CVE(涉及 7 种语言),单 agent 准确定位了其中 8 个漏洞的具体文件、行号与 CWE 分类,整套工具包则识别出全部 10 个——开发者强调这些漏洞都晚于模型训练截止日,排除了记忆复现的可能。
这个框架引发的反响,恰恰说明行业对「AI 驱动安全工具」的接受度在变。但它也把一把双刃剑摆到了台面上:你训练来写业务代码的 agent,现在可以被一层编排直接变成攻防武器,而且不需要额外密钥、不需要云预算。对防御方而言,这降低了红队门槛、让团队能用 agentic 速度做持续自查;对攻击者而言,同一套「复用现成编码 agent」的思路同样可用。框架作者明确声明仅限授权测试、研究与教育用途,采用 AGPL-3.0,不提供担保,并提醒未经书面授权测试系统在多数司法辖区仍属违法。
「无密钥作战」是一把双刃刀,这点必须讲明白。对防御方,它把红队门槛压到极低:不用为新模型付费、不用新开密钥,本地已经跑着的编码 agent 直接变成作战单元,团队能用 agentic 速度做持续自查,发现传统周期渗透测漏掉的多步链式漏洞。对攻击者,同一套「复用现成编码 agent」的思路同样可用——你训练来写业务代码的 agent,也可能被类似的编排反过来对你。框架作者把使用范围限定在授权测试、研究与教育,并强调未经书面授权测试系统在多数司法辖区仍属违法。工具的民主化从来一体两面,agentic 红队的普及,最终会倒逼蓝队把防御从「人盯报告」升级到「机读、可验证、持续」。
需要泼的冷水也有:目前只有侦察引擎与单 agent 利用循环经过基准验证且稳定,八算子里的其余部分尚在补齐;它偏向授权测试场景,并非开箱即用的企业平台。和本站此前覆盖的 AgentXploit(把仓库到运行时的自主红队做成可复现基准)相比,T3MP3ST 的定位是「能真正用起来的武器化框架」,而非评测研究。对安全团队更实际的姿态是:把它当作内部自查的加速器,在隔离环境与明确授权范围内跑,用来发现传统周期性渗透测试漏掉的多步链式漏洞;同时对自家编码 agent 的会话权限保持警惕——因为同一份能力,对手也可能用类似的编排反过来对你。工具的民主化从来都是一体两面,agentic 红队的普及,最终会倒逼蓝队把防御也从「人盯报告」升级到「机读、可验证、持续」。