智能体怎么变强:改权重,还是改工件

智能体从经验里变强,主流做法是改模型权重,可权重一改就难解释、难回滚。AgentGarten(arXiv 2610.12374)换了个思路:环境由仿真器和游戏引擎持有持久状态与规则,再接一个共享的神经渲染器——用 Adversarial Forcing 蒸馏出的视频模型,实时产出逼真观察。智能体在这个世界里行动、观察、反思,然后把每轮经验蒸馏成 playbook,交给下一轮智能体继承。

权重冻结,学习活在外面环境代码+渲染器智能体行动观察/反思蒸馏成 playbook交给下一轮继承权重不动;playbook/rulebook/skill 承载跨轮改进同一任务约 4 轮学会,传统 RL 要百万步
图|AgentGarten 让智能体在带渲染器的仿真环境里行动,把每轮经验蒸馏成可继承的 playbook,权重始终冻结。

关键点在于:权重冻住,学习活在外面。playbook、rulebook、skill 这些外部工件带着改进跨轮传递,模型本身不动。论文里一个对比很直观:同样是复杂任务,传统 RL 智能体要百万步才学会,AgentGarten 大约 4 轮就够。外部工件成了「经验的可移植载体」,新智能体不用从零踩坑。

自进化正在从改权重转向改工件

这股风在近期多篇论文里同时出现:自进化不再执着于微调权重,而是把改进写进可读、可版本化、可审计的规则与手册。好处是明显的——你随时能看智能体「学到」了什么,能回滚某一版 playbook,也能在多智能体间共享同一份经验。代价是供应链风险:这些工件一旦被到处复制却不再更新,就可能带着过时或错误的经验扩散。

学会同一任务所需代价传统 RL:百万步AgentGarten:约 4 轮口子:外部工件到处复制却不更新,会带过时经验扩散
图|把改进写进可读、可版本化、可审计的外部工件,比端到端微调权重更易在企业里落地与回滚。

对做多智能体系统的团队,AgentGarten 指向一种更可控的进化方式:把「智能体变聪明」拆成「环境给反馈」加「经验变工件」两步,前者靠仿真,后者靠继承。比起端到端训一个大模型,这条路更容易在企业里落地——毕竟没人愿意让生产 Agent 偷偷改自己的权重,却可以接受一份能审阅、能回滚的 playbook。