2026 年 9 月,来自中关村实验室、清华大学与中国移动的团队发布了一篇题为 VRL-Bench 的论文与配套框架,用 16,946 次试验系统比较了 verbal memory(也就是「反思」)类方法与纯重试在智能体任务上的真实表现。结论并不讨好主流叙事:Reflexion 以及两种更新的记忆方法,在全部六个模型-环境组合里,没有一种能稳定胜过「什么都不记、失败了就重试」的基线;真正在六个组合里全部胜出的,是一个把「何时探索、何时利用」当作调度问题来处理的 VEX2 框架。这篇论文给近两年被热炒的「给智能体加记忆、加反思」思路,泼了一盆需要及时的水。
反思类方法:各有输赢,没有常胜
VRL-Bench 的设定很克制:所有方法拿到相同的完整试验次数,在三个模型(DeepSeek-V4-Flash、GPT-5.4 nano、GLM-4.7-FlashX)与两个基准(MiniWob、WebShop)的组合上比拼成功率。结果里,Reflexion 在六个组合里赢了四个,DC-Cu* 赢了两个,ACE* 赢了五个——听起来不差,但关键在于它们也都输掉了另外几个。更扎眼的是方向:Reflexion 在 GPT-5.4 nano 的 WebShop 上带来 16 个百分点的提升,但 DC-Cu* 在 GLM-4.7-FlashX 上却是负收益。同一个方法,换一个模型就可能从助力变拖累。
论文还专门做了反思重放的实验:让失败的反思文本反复抵达执行器,结果在 WebShop 里,一个任务带着一段紧凑的失败总结,连续六次都没解出来,而纯重试反而第二次就换了一条路走通。反思把智能体锚在了错误的路线上,而全新的随机重试却找到了出口。这说明,把失败经验写下来并反复携带,并不天然等于「学得更好」,有时只是把错误的方向记得更牢。
VEX2 的切口:不做更好反思,做更好调度
真正胜出的 VEX2,思路和其他方法不在一层。它不试图写出更聪明的反思文本,而是把失败后的处理重新定义成一个探索-利用的预算分配问题:在有限的剩余试验次数里,用语言模型去决定追哪条策略、把预算花在新探索还是已知利用上。这个方法在六个组合里全部胜过纯重试,在 WebShop 上带来 8 到 17 个百分点的提升,且在每个设置里都减少了被截断的平均试验次数。换句话说,它挽回的失败案例更多,耗费的预算更少。
VEX2 的启示很清楚:智能体「失败后怎么学」这件事,比「有没有记忆」更值得工程化打磨。当行业把大量精力花在怎么让智能体写更好的反思、存更全的记忆时,这篇论文提示了一个被低估的维度——把学习与探索当成一种资源调度,而不是一种文本生成。对构建者而言,与其盲目给智能体加记忆模块,不如先想清楚:在什么情况下该探索新路,什么情况下该沿用已知。
对行业的冷静提醒
这篇论文的价值,不在于否定记忆与反思——它们在特定设置里确实有用,而在于否定了「加了记忆就一定更好」这种笼统假设。智能体的学习方法高度依赖模型与环境的组合,平均数字会掩盖方向,只有按设置分别看,才能知道某次改进是真收益还是噪声。对正在把智能体往生产里推的团队,这是一个务实的提醒:与其追逐最新的记忆机制,不如建立自己的评估,先量化「这次加的模块到底在哪些设置里帮了忙、在哪些设置里添了乱」。目前论文以 arXiv 预印本形式公开,具体编号以 arXiv 页面为准,后续将持续跟进迭代动态。