一句话:agentic RL 的涨分,可能一直被读错了

9 月 17 日提交的论文「Reach or Solve?」(arXiv 2609.19636)给强化学习训练出的 agent 泼了一盆结构性的冷水:那些漂亮的成绩提升,很大一部分可能不是「更会解题」,而是「走到了更容易解题的状态」。这两件事在传统评测里根本分不开。

问题的根源在于闭环本身。agent 在环境里写自己的输入:它的每一步动作决定了下一步观察到什么。于是一个 RL 检查点和一个 SFT 检查点即便跑同一批任务,它们各自面对的状态分布也不同——RL 版本遇到的后期状态,是它自己的早期行为塑造出来的。直接比分,你分不清涨的分里哪部分来自「决策更好」,哪部分只是「运气站在了一个自己造出来的好状态里」。

检查点交接:把「到达」和「解决」拆开

论文的解法叫检查点交接:让 RL 检查点从 SFT 策略走出来的状态出发继续完成任务,反过来也让 SFT 从 RL 到达的状态开始解题。这样「到达某个状态」和「在某个状态下把活干成」就被分到了两本账上——前者叫交互(reaching),后者叫解决(solving)。

这套估计器的设计相当谨慎:用于估计「解决谱」的样本在查看目标集结果之前就已独立选定,预测与观察之间的残差被显式报告。在 ALFWorld 上,观察到的交互增益是 24.2 个百分点,独立样本估计出的交互预测是 20.7 个百分点,残差 3.5 个点(95% 置信区间从负 7.2 到正 14.2)。翻译成人话:RL 相对 SFT 的净改善里,与「到达了更好状态」相关的部分占了大头。

闭环里的评分混淆:状态是 agent 自己造的SFT 检查点的处境从头出发,靠自己的策略走走不到的关键状态,连「解题」的机会都没有RL 检查点的处境起点状态由闭环早期行为塑造,后期遇到的状态一部分是它自己「造」出来的同一任务,不同起点——直接比分不分真相解法:检查点交接——让 RL 从 SFT 打磨出的状态出发继续解题(反之亦然),把「到达了更好的状态」与「同状态下更会解题」拆开记分。
图 1|传统比法混淆了两件事:走没走到好状态,和走到之后会不会做。交接法把两条账分开算。

两个极端案例,讲透分解的意义

论文按任务类型拆开看,反差极大。放置类任务上 RL 只比 SFT 多约 5 个点——因为 SFT 本来就能解出九成半的已到达状态,没什么可涨的。而清洗后放置类任务上,增益接近一百个点:SFT 在这类状态下从零起步,RL 版本则把它带到了能做的位置上。

这两个极端说明,笼统的「RL 让 agent 提升了多少」是个没有操作价值的说法。真正的信息是:RL 的价值 concentrated 在哪类状态的「可达性」上。对工程团队,这意味着选型时先问的不该是「RL 版本分数高多少」,而是「我们任务里的关键状态,训练后的策略能不能稳定到达」——如果到达没问题,瓶颈在解题,钱应该花在别处。

ALFWorld 上的分解结果(论文实测)观察到的交互增益(RL 相对 SFT)24.2交互预测(由独立样本的解题谱估计)20.7残差 3.5(95% 区间负 7.2 至正 14.2)两个极端案例说明了什么· 放置类任务增益仅约 5 个点:SFT 本就能解九成半的状态· 清洗后放置类增益约 100 个点:SFT 从零起步,全靠走到对的状态含义:agentic RL 的账,要从「到达」与「解决」两栏分开读。
图 2|24.2 个点的观察增益中,交互预测贡献 20.7——大头是走到好状态,不是同状态下突然变强。

对评测方法论的连锁影响

这篇论文撬动的不只是对 RL 的解读,还有整个 agentic 评测的公信力基础。当前的主流比法——不同检查点各自完整跑一遍基准——天然混入了「状态由谁造」的变量。跑分排行榜上相邻的两个模型,成绩差可能完全来自状态分布的差异,而非能力差异。论文在 TravelPlanner 上用环境原生存档做的复算也支持这一担忧:评分方式本身会引入交互。

可行的改进方向已经摆在桌面:评测协议应当报告「到达谱」与「解决谱」两栏,或者至少在比较两个检查点时,从对齐的状态分布出发。这对模型厂商与基准维护者都是额外的工作量,但比起让采购方基于混淆的分数做决策,成本算低的。

放在 agentic RL 的热潮里看

过去一年,agentic RL 是涨分最快的方向,论文标题里的那句「gains are large」没有说错。它质疑的不是涨分,而是读法——把「走了好运」读成「长了本事」,短期是叙事偏差,长期会误导资源投向。值得强调的是,这项研究并没有否认交互能力的价值:能稳定到达关键状态,本身就是可部署性的核心。它反对的是把两本账混成一本。接下来值得盯的信号,是主流基准是否开始分栏报告——官方及行业暂未披露更多细节,后续将持续跟进迭代动态。