9 月 22 日,多家媒体披露,润建股份旗下「润建·智御」安全产品——Hiveptagi 蜂巢 AI 渗透测试系统,在腾讯安全云鼎实验室推出的智能攻防 Agent 评测体系 TSecBench 最新一轮评测中,以 98.44 分登顶榜首。这并非一次普通跑分:Hiveptagi 全程零人工介入,自主完成信息收集、指纹识别、攻击面研判、漏洞验证利用、权限获取与横向移动等完整攻击链环节。在此之前,它已以 93.91 分位列榜单第二,本轮把分数进一步推高到 98.44,持续刷新自身成绩。

TSecBench 的定位本身就值得说清。它由腾讯安全云鼎实验室推出,聚焦自动化红队与对抗性 AI 能力验证,通过真实漏洞、生产级靶场与红蓝对抗环境,以统一标准衡量 AI 在自主渗透、漏洞挖掘与对抗博弈中的表现。截至本轮,它已累计测评超过 15527 个智能体、21151 个任务数,覆盖 160 多个安全场景。和传统「答题式」评测不同,TSecBench 更看重 Agent 在真实环境下的自主分析、研判与执行能力,本质是用实战方式检验智能攻防 Agent 的综合水位。

蜂群式协同,是 98.44 分背后的架构选择

据润建披露,Hiveptagi 面向真实攻防场景构建了「蜂群式多智能体协同」架构。在同一作战任务下,多个渗透智能体并行作业,分别承担侦察、主攻、验证、支援等不同角色;它们通过统一作战图共享攻击路径、情报成果与失败经验,以此减少单智能体反复试错带来的效率损耗。这种打法的逻辑不难理解:渗透测试天然是多阶段、高分支的任务,单一智能体在长链路里容易陷入局部循环,而把任务拆给角色各异的并行智能体,再用共享状态把它们拧成一股绳,既抬高了覆盖面,也压低了重复尝试。

同一作战图下,四种角色并行作业 侦察 · 信息收集 · 指纹识别 · 攻击面研判 · 情报上报 主攻 · 漏洞验证 · 利用获取 · 权限提升 · 横向移动 验证 · 复现确认 · 可 exploitation · 结果复核 · 阻断误报 支援 · 失败经验 · 路径共享 · 资源调度 · 协同推进 统一作战图:让四种角色共享攻击路径、情报与失败经验
图 1|蜂群式协同把角色拆开、把状态打通,减少单智能体反复试错

不过要把成绩读冷静。98.44 分来自一套特定评测体系的靶场环境,它证明了系统在受控实战场景里的自主规划与工程稳定性,却不等于在开放互联网上同样无懈可击。红队 Agent 在靶场里表现越好,越容易让人误以为「部署即安全」;但真实攻防的变量——授权边界、目标异构性、防御方的反制手段——远多于测评设定。对采购方而言,这类榜单更该被当作「能力准入门槛」而非「效果保证书」。

把它放进更大的坐标系:中国厂商在智能攻防上的两条腿

Hiveptagi 的登顶,和同一周海外发布的 PWNBench(Novee 联合 Fireworks 推出的真实活应用渗透测试基准)形成了一组有意思的对照:一个在榜单上把产品跑出高分,一个在造衡量模型的标尺。两条路径合在一起,说明智能攻防这条赛道正在从「堆工具」走向「拼实战、拼度量」。对国内安全厂商,这意味着产品叙事要从「我有多少智能体」转向「我在真实环境里能稳定拿下什么、又能被独立验证到什么程度」。人类专家的复核与授权审批,依旧是不可被分数替代的兜底。

从 93.91 到 98.44:分数在涨,覆盖也在涨 93.91 98.44 此前第二 本轮登顶 累计覆盖 15527+ 智能体 21151 任务数 160+ 安全场景 分数为特定评测体系下的实战水位,不等于开放互联网的鲁棒性
图 2|榜单证明受控实战里的自主规划能力,但采购方应视为准入门槛而非效果保证

把这类成绩放回采购语境看,它是一家厂商在自家产品上的实战水位,并非跨厂商的独立排名。榜单能说明产品在某套标准下跑得通,却替代不了授权边界梳理、目标适配与上线前的人工复核——Signal 归 Signal,选型仍要落到这些硬约束上。

落到工程实践,Hiveptagi 这类系统给出的启示是双重的。对内,蜂群式协同的价值不在「多」而在「通」:角色分工再细,若没有统一作战图把侦察、验证、支援串起来,就只是更多各自为战的尝试;对外,任何零人工介入的承诺都必须配齐审计轨迹与人工熔断点,否则一次误判会被自主执行放大成真实损害。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。