8月4日,多家行业观察汇总披露,OpenAI 宣布其内部版下一代模型 Astra 在10个长期悬而未决的数学与理论计算机科学开放问题上取得新结果,其中部分问题十余年没有核心进展。成果覆盖群论、高维几何、编码理论、算术电路复杂度、量子复杂度、格密码与极值组合等领域,包括构造证明非 sofic 群的存在、推翻 Connes 刚性猜想、给出新的球填充上界、解决若干由数学家保罗·厄尔多斯(Paul Erdős)提出的问题;机器可校验的 Lean 证明已发布在 GitHub 上。OpenAI 称这项工作约花费2000美元算力(按 GPT-5.6 Sol API 费率计),意图是把 Astra 定位为科学家与数学家的实用研究工具。这标志着大模型的能力前沿,正从「答题」向「发现」移动。
一、十道题的分量:十余年未解的开放问题
理解这次突破的分量,要先分清「习题」与「开放问题」。数学竞赛题大多已有标准解法,而开放问题(Open Problem)是数学界公认重要、却长期无人攻克的命题。Astra 触及的群论、高维几何、编码理论、算术电路复杂度、量子复杂度、格密码与极值组合,横跨纯数学与理论计算机科学的核心地带。其中,构造证明非 sofic 群的存在、推翻 Connes 刚性猜想、给出新的球填充上界、解决若干厄尔多斯问题,都不是边缘猜想,而是领域内卡了十年以上的真问题。这意味着模型面对的不再是「有答案的题库」,而是人类尚未填上的知识空白——这是性质上的不同。
二、机器可校验:Lean 证明为什么关键
数学发现最怕「看起来对,但证不了,或者证错了」。大模型此前在数学上的表现,常陷入生成「似是而非的推导」的陷阱。Astra 这次把机器可校验的 Lean 证明发布到 GitHub,意义在于结果可以被形式化验证社区独立核对,而不只是模型自述「我证出来了」。把 AI 数学从「生成自然语言证明」推向「产出可审计的严格证明」,是可信度上的一级跳。它也让「AI 辅助数学研究」从演示走向可被数学界接纳的工作流——研究者可以像审查同事论文一样,逐行验证 AI 给出的证明。
三、成本信号:2000美元算力的「研究助理」
OpenAI 给出的另一组数字同样耐人寻味:约2000美元算力(按 GPT-5.6 Sol API 费率估算)产出了10项新结果。这把前沿模型定位为「廉价研究助理」,而非只能炫技的聊天工具。它与早前报道中 Astra 多智能体长时程协同、能跑完整研究流程的叙事相互印证——Astra 的目标不只是回答问题,而是能规划、检索、推导,最终交付可验证的研究成果。对科研的意义在于,它有望把数学家从繁琐的推导与验算中部分解放出来,加速假设的提出与验证,让人类专家把精力投到更具创造性的环节。
四、客观看:突破与未竟
价值在于,这是 AI 首次在开放数学问题上产出带形式化证明的新结果,是大模型推理能力的一座里程碑,也预示「AI for Science」从生成走向发现的可能拐点。但边界需如实说明:其一,信息来自 OpenAI 披露与行业汇总,具体证明细节与独立评审仍在进行,10项结果的成色(是否均为领域公认重要、是否被数学界全部接受)有待社区核实;其二,模型为内部版本,公开可用时间尚未确定;其三,约2000美元的算力成本按 Sol 费率估算,真实科研落地成本取决于任务复杂度与验证开销;其四,AI 在基础数学上的突破,尚不意味着它已能独立主导需要深刻直觉与跨域洞察的顶尖研究。一切以官方与数学界的最终核实为准,这恰恰也是 Lean 证明被公开的意义——把判断权交还给可验证的社区。