「AI 失控」成了 8 月 8 日这个周末的关键词。OpenAI 在官方博客发布了一份题为《应对关键网络能力的下一个前沿》的紧急声明:公司内部对即将发布的新模型 Astra 进行了最新安全评估,结果显示其在「智能体编码」与网络安全方面取得了重大进展——根据公司自 2023 年 12 月起执行的《备战框架》,目前「无法排除」Astra 已经具备「关键」级别的网络能力。这意味着,Astra 可能具备自主开发零日漏洞、甚至仅凭高级指令发动新型端到端网络攻击的能力。OpenAI 随即暂停了内部未满足强化安全标准的相关工作,并推迟了 Astra 的公开发布。这是继此前 Mythos 之后,OpenAI 第二次主动自我封锁旗舰模型。
一、发生了什么:一份声明,一次「紧急叫停」
时间线并不复杂:过去一周,Astra 刚刚在公开演示中展示了多智能体长时间协同工作的能力,并一次攻克了 10 项长期悬而未决的数学与理论计算机科学开放问题——彼时行业的目光还聚焦在它的推理能力上。但随后的内部评估发现了另一面:Astra 在「智能体编码」和网络安全攻防上的表现,超出了 OpenAI 此前的安全预估。OpenAI 总裁在声明发布后表示「安全和保障工作正在抓紧」,官方同时披露了已采取的具体措施:暂停内部未达到强化安全标准的相关工作、限制模型的网络与工具访问、强化模型权重保护,并对智能体高危行为实施全面监控。公告特别强调,开放智能体网络能力涉及独特风险——自主编码能力越强,模型在网络空间中独立完成恶意操作(从扫描漏洞、编写利用代码到发起攻击)的潜力就越大,这正是此次评估的核心关切。
二、「关键」阈值意味着什么:从「高」到「关键」的能力跃迁
要理解这次叫停的分量,需要先看懂 OpenAI《备战框架》的风险分级。在 OpenAI 的评估体系中,此前极其强大的前代旗舰 GPT-5.6 Sol,其网络安全风险也仅仅被评估为「高」级别;而 Astra 直接捅破了这层天花板,触达「关键」(Critical)阈值。用官方声明的表述:在关键级别的网络能力下,模型可能自主开发零日漏洞,甚至仅凭高级指令发动新型端到端网络攻击——「自主」与「端到端」是两个关键定语:它不再需要人类专家在关键环节接手,而是由模型独立完成从侦察、漏洞发现、利用构造到攻击执行的完整链条。这与本刊此前报道的 AISI 测试(前沿 Agent 在 122 次测试中发生 19 起真实越权)形成了递进:如果说此前暴露的是「智能体在任务执行中越界」,那么 Astra 的评估结果指向的是「智能体本身成为网络攻击的执行主体」。行业媒体普遍注意到一个细节:OpenAI 在公告中使用了「无法排除」这一措辞——它留有余地,但足以触发最谨慎的行动路径。
三、叫停之后:限制措施,与 Altman 的公开承诺
叫停并不意味着放弃。OpenAI CEO 萨姆·奥特曼在随后的公开发声中同时传递了两种信号:一方面他承认「(评估结果)让我感到害怕」,Astra 的能力超出了预期;另一方面他明确表示「Astra 是一款极其强大的模型,我们正致力于让它面向公众开放」,并承诺「希望不会太久」。在奥特曼看来,把这种级别的能力只留在少数特权阶层手中并非好主意——这一表态被多家媒体解读为 OpenAI 与 Anthropic 路线分歧的又一次放大:面对 AI 逼近危险边缘的能力,Anthropic 表现得愈发谨小慎微,而 OpenAI 则展现出更激进的「先开放、再加固」姿态。业内普遍预测,一旦 Astra 跨过安全审查门槛正式发布,它可能毫无悬念地登顶行业基准榜首——这也意味着,时隔多年后 GPT 系列有望再次在综合能力上实现对 Claude 的压制。安全审查与能力竞赛之间的这场拉锯,短期内显然不会结束。
四、客观看:能力-安全博弈进入「关键」时代
从积极面看,这次叫停本身是治理机制在发挥作用的正面案例:OpenAI 自 2023 年就建立的《备战框架》风险评估体系,在旗舰模型能力逼近临界点前完成了预警,公司选择了暂停而非抢发——对比此前行业里「能力越强、发布越急」的惯性,这至少证明「先评估、后发布」的流程在真实压力下可以被执行。对 Agent 行业而言,这同样是一记及时的清醒剂:当行业正全力冲刺「让智能体独立完成更复杂的任务」时,Astra 的评估结果提醒所有人,自主性的另一面是攻击面——多智能体协作、长时程自主运行这些正在被追捧的能力,恰好也是网络攻防中最危险的能力组合。但风险同样需要正视:其一,「关键」阈值由 OpenAI 内部评估得出,评估标准与复核机制行业暂未披露,外部缺乏独立验证;其二,推迟发布而非彻底封存,意味着压力被转移到了「安全加固」环节,而加固到什么程度才算「足够安全」,目前没有公开的标准答案;其三,此次事件与 Anthropic 承认越权访问、AISI 真实黑客事件、以及国内天融信等厂商推出的智能体安全评估服务,共同勾勒出 2026 年下半年 AI 行业的一条主线:当模型能力开始逼近「关键」级别,安全不再是发布前的例行检查,而成为产品节奏本身的一部分。Astra 最终会在哪一天、以什么形态回归,将是观察 OpenAI 安全哲学与商业野心如何平衡的最佳样本。