智能体怎么变强:改权重,还是改工件
智能体从经验里变强,主流做法是改模型权重,可权重一改就难解释、难回滚。AgentGarten(arXiv 2610.12374)换了个思路:环境由仿真器和游戏引擎持有持久状态与规则,再接一个共享的神经渲染器——用 Adversarial Forcing 蒸馏出的视频模型,实时产出逼真观察。智能体在这个世界里行动、观察、反思,然后把每轮经验蒸馏成 playbook,交给下一轮智能体继承。
关键点在于:权重冻住,学习活在外面。playbook、rulebook、skill 这些外部工件带着改进跨轮传递,模型本身不动。论文里一个对比很直观:同样是复杂任务,传统 RL 智能体要百万步才学会,AgentGarten 大约 4 轮就够。外部工件成了「经验的可移植载体」,新智能体不用从零踩坑。
自进化正在从改权重转向改工件
这股风在近期多篇论文里同时出现:自进化不再执着于微调权重,而是把改进写进可读、可版本化、可审计的规则与手册。好处是明显的——你随时能看智能体「学到」了什么,能回滚某一版 playbook,也能在多智能体间共享同一份经验。代价是供应链风险:这些工件一旦被到处复制却不再更新,就可能带着过时或错误的经验扩散。
对做多智能体系统的团队,AgentGarten 指向一种更可控的进化方式:把「智能体变聪明」拆成「环境给反馈」加「经验变工件」两步,前者靠仿真,后者靠继承。比起端到端训一个大模型,这条路更容易在企业里落地——毕竟没人愿意让生产 Agent 偷偷改自己的权重,却可以接受一份能审阅、能回滚的 playbook。