一句话:agentic RL 的涨分,可能一直被读错了
9 月 17 日提交的论文「Reach or Solve?」(arXiv 2609.19636)给强化学习训练出的 agent 泼了一盆结构性的冷水:那些漂亮的成绩提升,很大一部分可能不是「更会解题」,而是「走到了更容易解题的状态」。这两件事在传统评测里根本分不开。
问题的根源在于闭环本身。agent 在环境里写自己的输入:它的每一步动作决定了下一步观察到什么。于是一个 RL 检查点和一个 SFT 检查点即便跑同一批任务,它们各自面对的状态分布也不同——RL 版本遇到的后期状态,是它自己的早期行为塑造出来的。直接比分,你分不清涨的分里哪部分来自「决策更好」,哪部分只是「运气站在了一个自己造出来的好状态里」。
检查点交接:把「到达」和「解决」拆开
论文的解法叫检查点交接:让 RL 检查点从 SFT 策略走出来的状态出发继续完成任务,反过来也让 SFT 从 RL 到达的状态开始解题。这样「到达某个状态」和「在某个状态下把活干成」就被分到了两本账上——前者叫交互(reaching),后者叫解决(solving)。
这套估计器的设计相当谨慎:用于估计「解决谱」的样本在查看目标集结果之前就已独立选定,预测与观察之间的残差被显式报告。在 ALFWorld 上,观察到的交互增益是 24.2 个百分点,独立样本估计出的交互预测是 20.7 个百分点,残差 3.5 个点(95% 置信区间从负 7.2 到正 14.2)。翻译成人话:RL 相对 SFT 的净改善里,与「到达了更好状态」相关的部分占了大头。
两个极端案例,讲透分解的意义
论文按任务类型拆开看,反差极大。放置类任务上 RL 只比 SFT 多约 5 个点——因为 SFT 本来就能解出九成半的已到达状态,没什么可涨的。而清洗后放置类任务上,增益接近一百个点:SFT 在这类状态下从零起步,RL 版本则把它带到了能做的位置上。
这两个极端说明,笼统的「RL 让 agent 提升了多少」是个没有操作价值的说法。真正的信息是:RL 的价值 concentrated 在哪类状态的「可达性」上。对工程团队,这意味着选型时先问的不该是「RL 版本分数高多少」,而是「我们任务里的关键状态,训练后的策略能不能稳定到达」——如果到达没问题,瓶颈在解题,钱应该花在别处。
对评测方法论的连锁影响
这篇论文撬动的不只是对 RL 的解读,还有整个 agentic 评测的公信力基础。当前的主流比法——不同检查点各自完整跑一遍基准——天然混入了「状态由谁造」的变量。跑分排行榜上相邻的两个模型,成绩差可能完全来自状态分布的差异,而非能力差异。论文在 TravelPlanner 上用环境原生存档做的复算也支持这一担忧:评分方式本身会引入交互。
可行的改进方向已经摆在桌面:评测协议应当报告「到达谱」与「解决谱」两栏,或者至少在比较两个检查点时,从对齐的状态分布出发。这对模型厂商与基准维护者都是额外的工作量,但比起让采购方基于混淆的分数做决策,成本算低的。
放在 agentic RL 的热潮里看
过去一年,agentic RL 是涨分最快的方向,论文标题里的那句「gains are large」没有说错。它质疑的不是涨分,而是读法——把「走了好运」读成「长了本事」,短期是叙事偏差,长期会误导资源投向。值得强调的是,这项研究并没有否认交互能力的价值:能稳定到达关键状态,本身就是可部署性的核心。它反对的是把两本账混成一本。接下来值得盯的信号,是主流基准是否开始分栏报告——官方及行业暂未披露更多细节,后续将持续跟进迭代动态。