长程任务把智能体逼到一个两难里:把从开头到现在的全部历史塞回上下文,token 成本随步数线性上涨;压缩成摘要省了 token,却可能把后面步骤才用得上的细节悄悄抹掉。更要命的是,历史信息的相关性往往要等任务推进到后半段才显形——你早删的,恰好是后面要的。
FlowState 的切口很直接:别把记忆当成一份要反复重读的历史文档,而把「执行状态本身」当作可留存、可回看的记忆。它用语义化的状态节点保留每一步的类型与彼此关系,同时保留对原始工具观测的引用——细节不丢失,只是不再每次都摊开读。关键一笔是把「持久留存」和「按需取用」拆开:状态一直留着,推理时再逐步调出该看的那部分。
落到机制上有两个部件。ISU(Incremental State Update,增量状态更新)在单个执行循环内,根据新输入和反馈维护当前状态;PSA(Progressive State Access,渐进式状态访问)在推理过程中逐步揭示历史状态与支撑证据。两者合起来,智能体得以拿着新信息回头重估先前的决定,再决定下一步怎么走,而不是一条道跑到黑。
数字在同一模型 DeepSeek-V4-Flash 下对照得出:MemoryArena 平均成功率提高 4.55 分,τ³-Bench 平均通过率提高 13.95 分,而 token 总消耗反而下降约 43.2% 与 40.6%。读这组数据的姿势很重要——它不是「模型变聪明了」,而是「该记的记下来、该省的不反复读」,于是在长程任务里把上下文膨胀和细节丢失同时按住。
43% 的 token 降幅放到生产里不是小数。长程智能体的会话往往一开几小时,上下文里塞满早先工具输出,累计下来的调用账单很可观。FlowState 把「该看的历史」按需调出,意味着大部分时候上下文不用为全量历史付费——对按 token 计费的部署尤其划算。它和「加长上下文窗口」是两条互补而非替代的路:窗口变大解决「装得下」,FlowState 解决「装得对」,无差别回填仍会让模型被噪声干扰、被无关细节带偏。
放到近期记忆研究的脉络里看,FlowState 和异构记忆路由、记忆准入、记忆整合治理是同一股热浪里的不同浪头。差异在分工:那些工作多在改记忆的「存什么、怎么选」,FlowState 不动训练,只在推理期把「执行状态」当记忆来管,工程上更轻、更贴现有推理框架。当然局限也清楚:论文在同一模型设定下跑,评估集中在特定基准;真实生产里多工具、长周期、跨会话的状态一致性,仍要靠落地再验。对做智能体系统的团队,FlowState 给的提醒是——长程任务的瓶颈常常不在模型,而在「状态怎么留」,把执行过程沉淀成可检索的状态,比不断加长窗口更对症。
一个可类比的参照是软件工程里的检查点(checkpoint)机制:长任务跑挂了能回到某个状态接着来,而不是从头跑。FlowState 把这套思路搬进智能体推理——状态节点就是推理期的检查点,模型可以回看、回估、回退,而不必依赖把整段历史重读一遍。不同在于,检查点通常为了容错,FlowState 的状态还为了「在推理中持续用」,不仅防崩,更为省 token。
对评估方法也有提醒:很多长程基准只报成功率,不报 token 账单。FlowState 的价值一半在准确率、一半在成本,只看前者会低估它。企业上线长程智能体时,更该把「每成功一步的单位成本」纳入对照,否则容易选了一个更准但贵得多的方案。同一模型设定下那组数字的意义,正是把成本和准确率摆在了同一张桌上。