9 月 22 日,AI 渗透测试公司 Novee 宣布,其面向真实活应用(live web application)的 agentic 渗透测试基准 PWNBench,正式登陆 Fireworks 的 Specialized Intelligence Index(SII)。这条消息的小心机在于它戳破了一个行业习惯:多数公开基准考的是「模型在训练里见过的漏洞能不能认出来」,而 PWNBench 考的是「面对一个从没见过的运行系统,你能不能真的打进去、并证明它可被利用」——像真实攻击者那样。

PWNBench 由一线从业者搭建,刻意避开静态、有界的题目,转而逼近攻防的真实样貌:模糊、多步、需要在探索中不断调整。它被接进 SII,和它同台的还有 Harvey 的法律 Agent 基准、Doximity 的医疗 BedsideBench——也就是说,它从一开始就把自己定位成「领域专用的生产级标尺」,而不是又一个学术玩具。

首发结果暴露的,是模型之间的「能力分化」而非「谁更强」

首批结果最有信息量的地方,不是某个模型登顶,而是不同模型在不同维度上各擅胜场。在 F0.5(更看重召回的权衡)对成本的效率前沿上,Grok 4.5、Grok 4.6 与 DeepSeek-V4-Flash-0731 占据领先;Claude Opus 5 买下最高召回——在 k=3 设定下约 51%,代价是约 1400 美元的 API 开销,而 Kimi K3 以约 209 美元拿到 42% 的召回。精度维度上,Grok 4.6 与 Claude Opus 4.8 落在 70% 后半到 80% 初段。

没有「通吃」模型,只有不同权衡 Grok 4.5 / 4.6 效率前沿(召回/成本) DeepSeek-V4-Flash 同列效率前沿 Claude Opus 5 召回最高 51%(约 1400 美元) Kimi K3 42% 召回(约 209 美元) 精度维度 Grok 4.6 与 Claude Opus 4.8 落在 70% 末至 80% 初段 选型要看 workflow:你更容忍漏报还是误报,预算卡在哪一档
图 1|召回、精度、成本三轴互相拉扯,单点分数说明不了问题

这组数据拆穿了一个幻觉:不存在「一个模型通吃攻防」。召回高的往往贵,便宜的召回有限,精度与召回又未必同向。对安全团队而言,这意味着选型不能看单点分数,而要按自己的 workflow 去挑——你更容忍漏报还是误报?预算卡在哪一档?要打的是宽面扫描还是深潜利用?PWNBench 的价值,正是把这组权衡摆到台面上,逼着买方想清楚自己要什么。

它和 TSecBench 隔海呼应,指向同一件事

同一周,国内腾讯 TSecBench 把润建 Hiveptagi 推上 98.44 分榜首;PWNBench 则在海外造衡量模型的标尺。两条线合起来说明:智能攻防这条赛道正在从「堆智能体数量」转向「拼实战、拼可度量的真实能力」。Novee 自身背景也佐证了这一点——它由国家级攻防专家创立,四个月内融了 5150 万美元,资方包括 YL Ventures、Canaan、Zeev Ventures,足见资本对「真实可用的攻防智能体」的押注。

从「答题」到「真刀真枪破系统」 静态靶场 · 题目剧透漏洞 · 有界、可预测 · 考的是记忆 → 高分不代表能打 真实运行系统 · 从未见过的应用 · 模糊、多步 · 要证明可利用 → 考的是真实能力 PWNBench 把标尺从「认不认得漏洞」移到「打不打得进去」
图 2|基准的价值,是逼着买方想清楚自己到底要测什么

这套基准对国内团队也有借镜意义:当我们在 TSecBench 上比产品分数时,海外已经在造「衡量模型的标尺」本身。两条腿要一起走——既要有能打的产品,也要有能独立验证、可横向比较的度量,否则高分永远停留在自说自话。买方更该把基准当采购清单的输入,而不是结论。

落到买方视角,PWNBench 这类基准最实在的用处,是给「模型在我真实环境里到底行不行」提供了一个可横向比较的参照,而不是只看厂商宣传。但它也提醒一点:基准再真,也仍是抽样式的探针,不能替代持续的红队与人工复核。当攻击侧已经用上自主智能体,防御侧评估的标尺也必须从「答题」升级到「实战」——否则你测的是记忆,不是能力。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。