9 月提交的 arXiv 论文 2609.28771 提出了一个叫 META 的多智能体交易框架,关注点很具体:让交易智能体拥有「情景记忆」——不是事后把行情记下来检索,而是在做决策之前,先回忆相似行情下自己过去怎么应对的。框架结构很清晰(见图 1):指标智能体族(Trend、MACD、RSI 等)并行出报告,决策智能体融合多份报告给出买卖判断,记忆模块按行情状态召回过往 episodes,最后才到执行。

关键在记忆模块的位置——它排在决策之前,而不是决策之后的审计日志。决策智能体在融合指标报告的同时,会先向记忆模块「提问」:当前这种波动率骤升、量价背离、板块轮动的市场状态,过去哪几次长得像、当时怎么处理的、结果如何?召回的 episodes 带着反思与重要性权重,被自适应地重新加权,再喂回决策。记忆在这里是一道工序,不是档案室。

把记忆放在决策之前,听着只是顺序问题,实则改写了系统的责任链。事后检索是「出了错再翻旧账」,属于兜底;决策前回忆是「动手前先想清楚上次怎么栽的」,属于预防。前者不改变这一次判断,后者直接喂进这一次判断。META 把这道工序钉在决策智能体之前,意味着模型拿到的不只是当下的指标报告,还有一段被召回、加过权重的「经验旁白」——它的推理上下文因此多了一层时间维度。

指标智能体族 Trend/MACD/RSI 等并行出报告 决策智能体 融合多份报告 给出买卖判断 记忆模块 按行情状态召回 过往 episodes 执行 下单 动作 记忆模块在决策前先「回忆」相似行情下的应对,再自适应重加权 情景记忆让决策有了「盘感」
图 1|记忆不是事后检索,而是决策前的一道工序

情景记忆的巧思在于「按行情状态挑该回忆什么」(见图 2)。不同市场 regime 下,该记的东西不一样:震荡市里重要的是区间边界与假突破,趋势市里重要的是回踩确认与止损位,消息面空窗时历史形态权重更高。META 用「带结果的市场状态 + 嵌入 + 反思」组织 episode 库,相似状态被召回并标注重权重,决策修正的置信度随之上升、延迟下降。所谓「盘感」,在框架里被翻译成了一次带权重的回忆。

把 META 放进「智能体 + 量化」这条线看,意义在把记忆从通用检索拽回到决策闭环里。以往给交易智能体接记忆,常见做法是把历史行情与新闻向量化后做相似检索,决策时再拼进去;META 的区别是记忆的召回与重加权由当前行情状态驱动,且发生在决策前。这让「该记什么」随市场 regime 动态调整,而不是固定一套嵌入距离。

对量化团队,META 的启示不在「又多了一个记忆模块」,而在「记忆的触发时机」。很多量化智能体已经有行情数据库、因子库、新闻库,但它们大多在决策时被动拼接,很少在决策前主动「按当前市场状态回忆」。把记忆前置于决策,相当于给模型装了一层「情景直觉」——同样的技术思路,放到风控、排程、运维这类也讲「类似情况类似处理」的场景,同样成立。记忆的价值,往往不在存了多少,而在被调用的时机对不对。

当前行情状态 · 波动率骤升 · 量价背离 · 板块轮动中 · 消息面空窗 episode 库 带结果的市场状态 嵌入 + 反思 相似状态被召回 并标注重权重 决策修正 置信度 提升 延迟 下降 不同行情下「该记什么」不一样,召回与重加权也跟着变
图 2|情景记忆的关键,是按市场状态挑该回忆什么

照例留一分清醒:META 是学术论文框架,回测与仿真结果来自论文口径,真实市场里的滑点、流动性与黑天鹅能否复现尚待验证;「情景记忆按状态召回」在极端行情(样本外 regime)下是否反而放大过拟合,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。但对工程团队的可操作启示明确:如果你的智能体在相似情境下反复给出不稳定的判断,与其加特征,不如先给它一个「按当前状态回忆过往应对」的记忆前道工序——决策之前先想想「上次这样是怎么收场的」。对工程团队而言,记忆前置于决策这一刀,比堆叠更多特征往往更划算:相似情境下反复误判,常常不是因为信息不够,而是因为系统从没在动手前认真回想「上次这样是怎么收场的」。