记忆系统答「有什么」,这张图答「接下来怎么办」

长程任务里的智能体有个共同的毛病:轨迹一长就丢目标、乱序调工具、在同一个坑里反复摔。9 月 8 日挂上 arXiv 的一篇论文(2609.09153)给了这个老问题一个新容器——Procedural Graph,程序图。作者来自 Google、佐治亚理工与北京大学团队(Yuxing Lu、Yicheng Chen、Shanchan Wu、Sercan Ö. Arık),全文 36 页、6 图 11 表。

思路的起点是一个类比。知识图谱把事实知识组织成「实体—关系—实体」三元组,回答「是什么」;程序图把程序知识组织成「过程—关系—过程」三元组,回答「接下来怎么办」。图上的节点可以是一项技能、一个工具函数、一次内部推理,也可以是一个任务状态;连接节点的有向边携带三个字段——什么条件下适用、执行时有什么建议、哪些坑要避开。论文给的例子很生活化:「预测现金流」连向「申请融资」,条件是现金支撑时间低于安全缓冲,建议是提前申请为到账留时间,要避免的是在已有申请未完成时重复发起。

同一张图的语言:知识图谱答「是什么」,程序图答「接下来怎么办」知识图谱(事实三元组)(实体,关系,实体)实体 A实体 B关系回答:这是什么、和谁有关服务于查询与检索程序图(过程三元组)(过程,关系,过程)过程:预测现金流过程:申请融资边上三字段条件:现金支撑低于缓冲建议:提前申请留出到账避免:重复发起未决申请回答:什么条件下、该做哪一步
图 1|程序图把「怎么做」显式写成过程三元组,边上挂条件、建议与避坑三字段,让衔接关系变成可检查的数据。

执行时不重训权重,靠读图给指导

落到执行上,框架在每一步先定位智能体所处的活跃节点,再由一个指导模型把周围子图翻译成步骤级的情境化指导——它影响求解器的下一步动作,但不替它做决定。这与近期记忆赛道的热点其实是两个层面:MemCalib 一类工作校准的是「该不该用记忆、用多少」,程序图管的是「步骤之间怎么衔接」。记忆回答库里有什么,程序回答此刻该做什么,两者叠加而非互替。

自进化闭环:改图的是模型,放行的是验证集

自进化闭环:改图的是模型,放行的是留出集验证执行轨迹对比失败 vs 成功LLM 精炼器提方案改拓扑、改边属性留出集验证不退步才提交通过:写回程序图骨架起步也能长成驳回:保留在图里防止重复犯错图更新不重训模型权重,执行时读当前节点附近子图生成情境化指导多数据集、多任务、多模型上一致跑赢记忆类基线;还能修复有缺陷的专家先验
图 2|闭环里真正卡质量的是留出集验证这道闸:通过才写回,驳回的方案也留在图中当反面教材。

这套结构真正值钱的部分在进化机制。一个 LLM 精炼器对比失败轨迹与成功轨迹,据此修改图的拓扑与边属性;修改方案必须先过留出验证集——只有保持或提升验证成绩的改动才会提交,被驳回的方案也会保留在图里,用来阻止后续重复犯错。从一张最小骨架出发,这个闭环能长出与人工设计相当甚至更好的图;给它一份有缺陷的专家先验,它还能把缺陷修掉。作者报告跨多个数据集、任务类型与模型,程序图相对记忆类基线取得一致增益,自进化进一步抬升上限而无需人工工程。

和技能库、上下文工程是什么关系

容易混淆的是程序图与近期几条热门路线的边界。技能库存的是可复用的做法本身,程序图存的是做法之间的关系——哪一步在什么条件下接哪一步、衔接时注意什么,技能可以嵌在节点里,图负责编排。上下文工程关心的是单次调用窗口里装什么,程序图关心的是跨步骤的顺序与条件,一个是空间问题,一个是结构问题。对工程团队来说,这套东西还有一个容易被忽略的好处:图是显式的,错了可以定位到某条边;提示词工作流错了,只能整段重写。被驳回的修改也保留在图里的设计同样聪明——智能体不会反复提出同样的坏主意,这在长周期自进化里比多涨几分更重要。

冷静看也有几处留白:论文摘要未给出具体数据集清单与增益幅度,指导模型本身的额外推理开销、留出验证集的质量依赖,都还需要正文与后续复现来检验;完整实验细节目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。但方向本身值得记一笔:当 harness 工程还停留在人手写提示词工作流的阶段,程序图把「怎么干活」变成了可读取、可检查、可修订的数据结构——这才是它区别于又一篇记忆论文的地方。