长程任务把智能体逼到一个两难里:把从开头到现在的全部历史塞回上下文,token 成本随步数线性上涨;压缩成摘要省了 token,却可能把后面步骤才用得上的细节悄悄抹掉。更要命的是,历史信息的相关性往往要等任务推进到后半段才显形——你早删的,恰好是后面要的。

长程任务里,记忆该存在哪(论文设定)老办法:把全部历史塞回上下文完整历史回填上下文成本随步数线性上涨压缩摘要省了 token,却可能丢掉后面要用到的细节FlowState:执行状态即记忆语义化状态节点保留关系与类型原始工具观测引用细节不丢,按需取ISU / PSA增量更新与回看留存与取用分开:状态一直留着,推理时再逐步调出该看的
图 1|FlowState 把「执行状态」做成可访问的记忆:节点保留语义关系,原始观测留引用,不在每次都重读全量历史。

FlowState 的切口很直接:别把记忆当成一份要反复重读的历史文档,而把「执行状态本身」当作可留存、可回看的记忆。它用语义化的状态节点保留每一步的类型与彼此关系,同时保留对原始工具观测的引用——细节不丢失,只是不再每次都摊开读。关键一笔是把「持久留存」和「按需取用」拆开:状态一直留着,推理时再逐步调出该看的那部分。

落到机制上有两个部件。ISU(Incremental State Update,增量状态更新)在单个执行循环内,根据新输入和反馈维护当前状态;PSA(Progressive State Access,渐进式状态访问)在推理过程中逐步揭示历史状态与支撑证据。两者合起来,智能体得以拿着新信息回头重估先前的决定,再决定下一步怎么走,而不是一条道跑到黑。

同模型 DeepSeek-V4-Flash 下对照(论文口径)MemoryArena 平均成功率4.55%涨分τ³-Bench 平均通过率13.95%涨分更明显token 总消耗-43%降 43% 左右关键在读法不是「更聪明」,而是「该记的记、该省的不反复读」——长程任务里成本与质量一起改善
图 2|两个基准一个涨分一个涨更多,token 却降了四成:执行态记忆同时压住了上下文膨胀与细节丢失。

数字在同一模型 DeepSeek-V4-Flash 下对照得出:MemoryArena 平均成功率提高 4.55 分,τ³-Bench 平均通过率提高 13.95 分,而 token 总消耗反而下降约 43.2% 与 40.6%。读这组数据的姿势很重要——它不是「模型变聪明了」,而是「该记的记下来、该省的不反复读」,于是在长程任务里把上下文膨胀和细节丢失同时按住。

43% 的 token 降幅放到生产里不是小数。长程智能体的会话往往一开几小时,上下文里塞满早先工具输出,累计下来的调用账单很可观。FlowState 把「该看的历史」按需调出,意味着大部分时候上下文不用为全量历史付费——对按 token 计费的部署尤其划算。它和「加长上下文窗口」是两条互补而非替代的路:窗口变大解决「装得下」,FlowState 解决「装得对」,无差别回填仍会让模型被噪声干扰、被无关细节带偏。

放到近期记忆研究的脉络里看,FlowState 和异构记忆路由、记忆准入、记忆整合治理是同一股热浪里的不同浪头。差异在分工:那些工作多在改记忆的「存什么、怎么选」,FlowState 不动训练,只在推理期把「执行状态」当记忆来管,工程上更轻、更贴现有推理框架。当然局限也清楚:论文在同一模型设定下跑,评估集中在特定基准;真实生产里多工具、长周期、跨会话的状态一致性,仍要靠落地再验。对做智能体系统的团队,FlowState 给的提醒是——长程任务的瓶颈常常不在模型,而在「状态怎么留」,把执行过程沉淀成可检索的状态,比不断加长窗口更对症。

一个可类比的参照是软件工程里的检查点(checkpoint)机制:长任务跑挂了能回到某个状态接着来,而不是从头跑。FlowState 把这套思路搬进智能体推理——状态节点就是推理期的检查点,模型可以回看、回估、回退,而不必依赖把整段历史重读一遍。不同在于,检查点通常为了容错,FlowState 的状态还为了「在推理中持续用」,不仅防崩,更为省 token。

对评估方法也有提醒:很多长程基准只报成功率,不报 token 账单。FlowState 的价值一半在准确率、一半在成本,只看前者会低估它。企业上线长程智能体时,更该把「每成功一步的单位成本」纳入对照,否则容易选了一个更准但贵得多的方案。同一模型设定下那组数字的意义,正是把成本和准确率摆在了同一张桌上。