据华尔街日报 9 月 17 日报道,独立安全研究公司 Hacktron AI 的三名研究人员,在不到 72 小时内用 Anthropic 的 Claude(报道称含 Opus 5)完成了一次对 OpenAI 内部系统的渗透:串联两个漏洞,进入一名 OpenAI 员工的 ChatGPT 与 Codex 账户,拿到有效令牌后读取了公司内部私有代码库 Monorepo,还成功提交了一个 PR 用于证明访问权限。OpenAI 已修复相关漏洞,并向研究团队支付 6500 美元漏洞赏金。

不到 72 小时的完整攻击链侦察漏洞串联进入员工账户拿到有效令牌读取内部代码库证明性动作研究人员还提交了一个 PR,用于证明对内部私有代码库的访问权限;随后按负责任流程报告智能体的位置人定目标,智能体承担侦察、漏洞链与利用工具化,把攻击工程从周级压到天级结果OpenAI 已修复,并向研究团队支付 6500 美元漏洞赏金工具:报道称为 Anthropic Claude(含 Opus 5);信息源以华尔街日报报道为准
图|不到 72 小时的完整攻击链

先把事件性质摆正:这是一次授权的红队测试,目标与范围事先约定,漏洞走负责任披露,与此前 Google TAG 披露的真实攻击——攻击者用多智能体框架在 6 小时内窃取数千第三方凭据、审计层仅捕获 4.1% 的事故真因(1099、1100 号稿)——性质完全不同。但两件事放在一起,恰好画出了同一条能力曲线的两端:同一类模型能力,既能支撑合规渗透,也能支撑真实犯罪。

值得拆解的是智能体在攻击链里的确切位置。这不是「AI 一键入侵」——目标由人设定,关键判断由人拍板;智能体承担的是侦察信息汇总、漏洞串联、利用代码编写与工具化这类繁重工程。安全行业过去常说的「AI 降低攻击门槛」,在这件事里有了具体的量化形状:一次针对头部 AI 公司、涉及员工账户与内部代码库的完整攻击链,从以周计压缩到了以天计。防御方要面对的不再是散落的攻击步骤,而是被工具化串联起来的完整流程。

另一层讽刺值得记住:被攻破的恰恰是 AI 公司自己。员工日常用 ChatGPT 与 Codex 处理高权限任务,意味着这类账户本身就是高价值资产——令牌一旦有效,智能体化的访问可以把「读取」升级为「可证明的写入」:提交一个 PR 就是访问权限的存证。对 AI 公司乃至所有大量部署智能体的企业来说,教训指向同一条:员工的智能体账户要按高权限资产管理,每次 agent 动作要可归因、可审计;本站此前跟踪的智能体身份治理与非人类身份最小权限线(922 号稿)讨论的正是这个问题。

同一条能力曲线的两面这次:授权红队目标与范围事先约定发现漏洞走负责任披露获得 6500 美元赏金对象:OpenAI 员工账户与代码库此前:真实犯罪活动攻击者用多智能体框架6 小时窃取数千第三方凭据审计层只捕获 4.1% 真因信息源:Google TAG 披露给 AI 公司的启示员工的智能体账户就是高权限资产;每次 agent 动作要可归因、可审计两个漏洞的具体细节未公开,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态
图|同一条能力曲线的两面

从防御视角复盘这条链,每个环节都有现成的断点可用:账户侧的硬件密钥与异常登录检测、令牌侧的短时效与最小权限、代码库侧的异常提交告警——漏洞串联之所以能走通,往往不是因为每一环都弱,而是因为链条太顺。红队把整条链跑通交给蓝队,恰好把这层「环节各自合格、组合仍然失守」的风险摊在了桌面上;对正在给员工配智能体工具的企业,这是一份免费且昂贵的参照样本。

治理层面的余波也已经在路上。同一款模型,既能被授权红队用来找漏洞,也可能被恶意者用来制造漏洞,平台方的使用政策与安全评测(Anthropic 此前发布过四款 Claude 模型的真实系统网络评测,1098 号稿)需要在「放行安全研究」与「拦截恶意使用」之间划出可操作的线——这次事件大概率会成为双方政策迭代的注脚。至于攻击链的两个漏洞具体是什么、影响面有多大,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。