两篇本周露头的 arXiv 论文,盯上了智能体强化学习里一个很隐蔽、却很要命的毛病:信用分配。SLCA-GRPO(编号 2609.29050)和 GRAFT(编号 2609.28963)分别从不同角度修同一个问题——当智能体做完一连串带工具调用的动作、只在最后拿到一个总体奖励时,朴素的 GRPO 会把这同一个优势值平均分给序列里的每一个 token,包括那些和工具调用毫无关系的思考 token。
一条奖励,被平均分给所有 token
这听起来只是个实现细节,实际后果却不小。智能体做工具调用时,真正导致调用发生的,往往是少数几个决策 token;可朴素 GRPO 把最终奖励也摊到了前面的长串推理 token 上。结果就是:模型学不到到底是哪一步真正起作用,于是要么过度试探、要么错用工具,工具调用的收益被大量无关 token 稀释。论文把这种现象归因为把单一轨迹级优势广播到了每个 token,并指出这恰是很多 agent RL 脆化的根子。
两篇论文的解法,都是把信用分配做得更细。SLCA-GRPO 按输出段拆分优势:执行奖励归到工具调用 token,偏好奖励归到总结 token,在 7B 模型上,对比 GRPO、ToolPO 与 RLTR,域内提升 2.53 分,在 BFCL 上提升 1.36 分,在 τ²-Bench 上提升 9.15 分。GRAFT 则把多条轨迹合并成一张图,用 Bellman 迭代恢复出逐步价值,在多轮智能体基准上优于 GRPO。两条路径不同,结论却指向同一处:信用分配的粒度,比我们以为的更影响工具调用表现。
换个直觉的说法,信用分配要回答的问题是:一条轨迹最后拿到了好评,到底该奖励谁?朴素做法把整根棒棒糖平均分给队列里所有人,于是真正伸手拿工具的那只手,和只是站在旁边思考的那几个人,拿到的一样多。时间一长,模型学到的不是「下次该在哪一步出手」,而是「多想几步、多试探几次也无所谓,反正奖励会摊到我头上」。这正是工具调用智能体常见的脆化来源——它学会了频繁调用工具刷存在感,却没学会把调用用在刀刃上。两篇论文做的,就是把棒棒糖重新分到真正伸手的那只手上。对正在用 RL 打磨工具调用智能体的团队,这个比喻本身就是一条验收项:先确认奖励真的落到了调用动作上,再谈别的优化。把信用分配当成一等公民,而非训练脚本里被忽略的一行默认值,是这两篇论文留给工程界最实在的提示。
对生产智能体,这是架构层面的提醒
客观地说,这组结果目前大多建立在 7B 这类较小模型和域内评测之上,外推到前沿大模型驱动的、已经在跑的生产智能体,还需要在自己的业务上复测,不能直接照搬百分比。但论文真正的价值不在某个数字,而在把一个常被忽视的工程判断摆上台面:当你用强化学习训一个会调用工具的智能体时,奖励到底怎么归因,可能比换一个更大的基座更值得花心思。对平台方,这也提示了一条产品化的方向——把信用分配做成可观测、可调的旋钮,而不是把整条轨迹压成一个标量奖励。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
把镜头拉远,工具调用智能体的强化学习,这几年一直是会调用和调得对之间的拉锯。SLCA-GRPO 与 GRAFT 没有宣称解决了这条拉力,它们只是证明:让奖励更精准地落到真正起作用的 token 上,智能体就能学得更快、也更少走弯路。对正在用 RL 打磨智能体的团队,比起继续堆参数,先把信用分配这层理顺,或许是一条更短的路。