用前沿 agent harness 去啃前沿数学,是最近一年冒出来的有效路径。可数学证明的麻烦在于:要解一个硬问题,往往要并行跑大量 agent、连续工作很久,产出堆积如山的中间结果,事实、计划、反例混在一起。怎么把这些中间产物组织起来,又怎么把上一题探索里学到的东西复用到下一题,是比「单步会不会做」更难的问题。10 月 2 日挂出 arXiv 的 Ansatz(编号 2610.02945)给出的答案,是一套叫 Continual Graph Memory 的图式、可演化、可跨题复用的研究记忆。值得一提,作者列表里有 Terence Tao 等人。
把探索轨迹织成一张图
Ansatz 的核心是把整个证明搜索过程显式地组织成图:所有中间探索结果,事实、计划、反例,都是节点,节点之间的边显式表达它们的关系。和那种把历史压成一段平铺文本的记忆不同,图结构让「哪些结论互为前提、哪些反例推翻了哪条路线」一目了然。配合依赖感知的取数,agent 能精准拿到本地需要的上下文,而不是每次都把整段历史塞进窗口。还有一个证据敏感的 curator,负责更新研究前沿、从早先的探索里提炼教训。
真把题解出来了一片
结果相当硬核。Ansatz 报告在 First Proof 第二批次的全部十道题上闭卷收口。更出圈的是,它在没有人工介入的情况下,额外解出了 Jamison 毛虫猜想,以及 Erdos 问题 289、348、488,并对若干开放问题取得部分进展。能做到这一点,靠的是图记忆把「证明搜到哪了」持续留存,再用 scoped recall 把早先的否定发现摆回本地重证,而不是不加分辨地复用旧结论。换句话说,它把「失败过的地方」也变成了可复用的资产。
给研究型 agent 的记忆一个新范式
Ansatz 提醒的是:对长程、开放、需要持续推理的研究任务,记忆不该是「把对话历史压成摘要」,而该是「把探索过程建成可查询的结构」。本站此前覆盖过网页智能体怎么用只追加记忆留住纠错反馈,也看过把记忆从容量之争引向写法之争的进展。Ansatz 把这条线推到了数学研究这种极端长程的场景:在这里,中间结论的复用效率,直接决定了能不能把一道开放题啃下来。当然,它在数学这种强结构领域验证得充分,换到工业界那种目标更模糊的长程任务,图记忆的构建成本和维护复杂度会不会反过来成为负担,仍要等更广的落地检验。
为什么数学是记忆系统的极端考场
数学证明之所以适合拿来逼问记忆系统,是因为它的长程与强结构。一道开放题可能要跑成千上万次探索,中间结论彼此依赖,一步证伪就可能推翻一整条路线;与此同时,证明的目标又足够清晰,容不下「差不多就行」的含糊。这种场景下,记忆如果只是把对话历史压成摘要,会在几轮之后把关键依赖弄丢,agent 于是反复踩同一个坑。Ansatz 用图来承接这种复杂度,等于承认:研究型任务的记忆,本质上是对「知识之间关系」的管理,而不是对「说过哪些话」的备份。
落到工程上仍有两道坎
把图记忆搬进工业界,要过的坎和数学不一样,但同样实在。一道是构建成本,节点与边的粒度怎么定、谁来保证图不随规模膨胀而失真,是数学之外更模糊的问题。另一道是维护复杂度,当任务目标不再像定理那样有明确定义,图的「研究前沿」该由谁推进、scoped recall 该召回哪一段旧结论,都需要更明确的策略。Ansatz 在强结构的数学领域把这条路走通了,但它也提示后来者:图记忆不是银弹,它把「记什么」的难题,换成了「怎么织、怎么剪」的新难题。
对做研究型 agent 的团队,Ansatz 的启示一句话就能说清:别再把探索历史压成一坨文本,把它织成一张图,让失败的位置也能被精确找回和复用。