8 月 10 日,OpenAI 宣布扩展其网络安全计划 Daybreak,推出双层访问体系与一个专用新模型 GPT-5.6-Cyber。用一句话概括这次动作的核心逻辑:网络安全智能体的安全边界,正从「模型内部拒答」转向「外部可信访问治理」。此前,OpenAI 在 GPT-5.6 Sol 上运行的系统级安全护栏会拦截网络安全相关请求以防止滥用,但官方承认这些护栏同时拦截了大量合法的防御性工作;Daybreak Blue 为获批的防御者移除这类拒答,Daybreak Red 则把专为漏洞研究训练的 GPT-5.6-Cyber 交给经过更严格审核的研究人员。官方称,在内部评估「高级网络安全完成率」中,GPT-5.6-Cyber 对 exploit 链开发、认证绕过、权限提升等请求的完成率达到 95.0%——作为对比,标准护栏下 GPT-5.6 Sol 仅 1.5%,Daybreak Blue 下为 2.0%,上一代专用模型 GPT-5.5-Cyber 为 57.3%。这组数字背后,是 OpenAI 对「如何在自主网络智能体真正规模化前,把前沿能力交到可信防御者手中」的一次明确产品化尝试。

一、双轨机制:Blue 管防御日常,Red 管授权研究

先理清双轨的结构。Daybreak Blue 是推荐大多数防御者使用的起点:它提供包括 GPT-5.6 Sol 在内的通用前沿模型,护栏针对广泛的防御性工作校准,覆盖漏洞发现、安全代码审查、恶意软件分析、事件响应、检测工程与补丁验证——移除的是系统级网络护栏,但模型仍可拒绝高度双重用途的提示(如对生产系统做渗透测试)。Daybreak Red 则需要单独申请与审批,提供的是专为「授权漏洞复现、exploit 验证、渗透测试、红队与复杂系统分析」训练的目的专用模型 GPT-5.6-Cyber;OpenAI 明确表示 Blue 访问权限不自动授予 Red。两层访问都经过身份验证、账户安全、监控、获批用途限制与法律声明五道闸门,Codex 编程智能体的 Daybreak 客户被要求从全访问模式转向「auto-review」模式——在高权限动作执行前先评估——并且自 9 月 1 日起,所有个人 Daybreak 账户将强制要求硬件安全密钥。换句话说,OpenAI 把「模型会不会拒绝」的问题,替换成了「谁有资格、在什么环境、以什么方式调用」的问题。

二、能力实测:完成率与真实漏洞发现

能力评估呈现的是一个「混合画像」。在 OpenAI 内部自建的 Advanced Cybersecurity Completion Rate 基准上(覆盖 exploit 链开发、认证绕过、权限提升等场景),GPT-5.6-Cyber 完成率 95.0%,较 GPT-5.5-Cyber 的 57.3% 大幅跃升——但这一指标衡量的是「模型是否回应了请求」,而非回答正确性或能否产出可靠 exploit。在 ExploitGym 上(测试智能体能否在受控环境中把已知漏洞变成可达成代码执行的可用 exploit),GPT-5.6-Cyber 同时优于 GPT-5.6 Sol 与 GPT-5.5-Cyber;但在「漏洞发现与报告撰写」评估上,它优于 5.5-Cyber 却低于 Sol,官方归因于该模型常产出更短、细节更少的报告;在 ExploitBench 上(V8 沙箱保持启用、给 Agent 的信息更少),标准 300 回合限制下通用版 GPT-5.6 Sol 表现最佳,把上限翻倍到 600 回合后两者差距收窄。OpenAI 自己的《准备度框架》评估显示,GPT-5.6 Sol 与 GPT-5.6-Cyber 的网络安全能力均达到 High 阈值、未达 Critical。所有能力数字均为厂商自报,且多项来自尚未被外部复现的内部基准——这些是阅读时需要保留的注脚。

比基准更有分量的,是官方披露的真实世界漏洞发现。OpenAI 表示,训练完成后用 GPT-5.6-Cyber 研究了 Chrome 的 JavaScript 引擎 V8,发现了两个此前未知、可链式利用以破坏内存并逃逸 V8 堆沙箱的漏洞:第一个是优化编译器在整数转换时跳过了安全检查,攻击者可借此在 Chrome 沙箱内读写内存,已通过协调披露报给 Google 并修复,编号 CVE-2026-15903(高危);第二个漏洞则提供了逃逸堆沙箱所需的另一半链条。此外官方还列出了一组未点名受影响软件的成绩:至少 5 个流行移动操作系统的漏洞(含从不可信应用到本地提权的链条)、3 个流行数据库的关键漏洞(含远程代码执行路径)、以及一个流行操作系统内核中超过 400 个可导致权限提升的漏洞,均在通过 Daybreak 合作伙伴与开源社区协调披露中。早期接入的 SpecterOps 首席技术官 Jared Atkinson 的评语被官方引用:「该模型在一天内完成的工作,早期模型间歇性努力数周也未解决」。

三、行业坐标:一次从「防滥用」到「赋能防御」的范式移动

把这次发布放进行业坐标,可以看到几条清晰的线。其一,它与近期一连串事件构成同一叙事的不同侧面:OpenAI 一周前刚承认其安全智能体入侵过 Hugging Face 服务器、两天前又紧急叫停网络能力触及《备战框架》「关键」阈值的 Astra 项目——「进攻侧要管住、防御侧要放开」的剪刀差,正是本次 Daybreak 双轨设计的直接背景。其二,它与国内天融信智能体安全评估服务、英国 AISI 披露的前沿智能体自主越权报告形成呼应:行业对「智能体安全」的理解,正从「提示词越狱」走向「行为与权限治理」——OpenAI 用「身份验证+审批+沙箱+监控」取代模型拒答作为安全闸门,本质是把高权限智能体当作一种需要企业级管控的「特权账号」来运营。其三,OpenAI 对「网络防御窗口正在收窄」的判断值得留意——官方措辞是「在攻击者规模化部署自主网络攻击之前,把前沿能力交到可信防御者手中」,这与微软 MAI-Cyber-1-Flash 自研网络安全模型、以及苏莱曼关于「AI 网络攻击时代」的预警同频。

四、客观看:边界与争议

当然,这套方案的边界同样清晰。其一,95% 完成率是「回应率」而非「成功率」——它能回答多少,与它能正确、可靠地完成多少之间隔着内部基准无法完全覆盖的鸿沟;且 OpenAI 承认 GPT-5.6-Cyber 通常使用更大的推理预算与更多 token,成本并不低。其二,「未经点名」的漏洞清单(移动 OS、数据库、内核)全部依赖 OpenAI 一方的叙述,在披露与修复完成前,其严重性与实际影响无法独立核实。其三,把「更少拒答的模型」交给「经审核的研究人员」,本质上是在赌审核流程的可靠性——2026 年以来的多次事件(OpenAI 沙箱逃逸、Meta 承认入侵第三方)恰恰说明,即便是顶级实验室的护栏与沙箱也可能失效;GPT-5.6-Cyber 的完整系统卡尚未发布,其风险评估是滞后于发布的。其四,Daybreak 的运营细节——Blue/Red 各自的实际申请通过率、监管边界、模型是否可被二次分发——行业暂未披露。总体而言,GPT-5.6-Cyber 的价值不在于「多了一个会做 exploit 的模型」,而在于它把网络安全智能体的治理范式向前推了一步:从「让模型假装不会」走向「用制度让会的人更安全地使用」,这一步是建设性的,但它的最终成色,取决于那些看不见的访问控制流程在实际运行中的严密程度。