一个仓库、722 篇手稿、没有署名的作者
10 月 6 日,OpenAI 在 GitHub 公开仓库 openai/math,一次性放出 722 篇由内部前沿模型生成的数学手稿,按 372 个相关结果族组织,以 Apache-2.0 许可发布。按官方口径,模型总计被投入约 4000 个问题,722 篇是公司判定值得发布的部分,折算约 18% 的产出率;题材横跨数论、代数几何、组合数学、理论计算机科学与数学物理等十余个领域。每篇手稿附引用说明与修订协议,而生成它们的模型既未命名也未发布,官方称其仍处安全评估阶段。
四个旗舰结果,措辞都很克制
Altman 点名的四项结果里,最受关注的是准黎曼猜想——证明 zeta 函数在实部大于 7/8 的区域无零点。这是对黎曼猜想(实部 1/2)的显著推进,但离原命题仍有明确距离;其余三项为 Unique Games 猜想、CM 阿贝尔簇情形的 Hodge 猜想与自由群因子问题。公司对框架的限定相当谨慎:Hodge 结果只覆盖一类形状,而非猜想全貌。标题与实际断言之间的这段距离,正是数学界审视的焦点所在。
验证分层:162 篇可机器查验,487 篇尚待人工
这批手稿的可靠性并不均质。第三方梳理显示,约 162 篇的主结果已有完整的 Lean 形式化证明——机器可逐行查验,可作为可靠起点;另有约 73 篇为部分形式化;剩余近 487 篇仅有 OpenAI 内部判定背书。OpenAI 自己的 README 写明,部分未形式化的结果可能存在问题——这种对不完整的坦承在旗舰发布里并不多见。另一个缺口在推理过程:仅 10 个结果族附有节选的推理摘要,而数学与 AI 顾问组 AGMAI 的建议是逐篇披露,这项要求只落实了很小一部分。
成本曲线在塌缩
把 9 月与 10 月的两次发布并排看,成本曲线的变化比任何单项结果都更值得关注。9 月 8 日的纳维-斯托克斯宣称(此前已另文覆盖)动用约 1 万个并发 Agent 运行 88 小时,花费数百万美元;本批 722 篇平均每篇仅耗约 3 小时 ChatGPT Pro 级别的思考算力,单 Agent、单提示词。三个月内,单结果的算力成本下降了若干个数量级——即使最终被验证的结果只占一部分,AI 产出候选数学成果的经济门槛,也已经越过了学术界的响应能力。
学术界:一边验收,一边警惕
外界的反应分裂在意料之中。背景是 9 月纳维-斯托克斯宣称引发的持续争议:25 位菲尔兹奖得主曾联署公开信,近 4000 名研究者签署呼吁负责任整合 AI 工具的莱登宣言;陶哲轩则在 ICM 全体会议上警告,生成式 AI 天然的不可锚定性叠加公司的财务激励,极易触发古德哈特定律——一旦解决著名难题成为能力基准,实验室就会针对基准本身优化。对照 AGMAI 10 月 1 日的发布指引,本次发布在独立仓库、来源披露与形式化三项上大体落实,推理摘要一项明显不足;随附的调查结论还澄清了 9 月的抄袭质疑——Buckmaster 的提示词不可能以任何方式影响该系统,包括训练层面。
接下来怎么验收这批资产
对数学界,722 篇手稿既是礼物也是负担:它们是可分诊的候选结果,也是有限人力面前的验收义务,最早被独立证实或证伪的旗舰结果,将为 3 小时思考算力的实际价值定标。对 OpenAI,这次发布把自家内部模型放进了科学验证文化最严苛的考场——证明是否成立,将由与公司估值毫无利害关系的数学家逐行裁决。华尔街日报的提醒同样在点上:即便证明存活,也不会直接变成订阅收入,它买卖的是能力叙事的公信力。官方及行业暂未披露更多细节,后续将持续跟进迭代动态。