9 月 24 日,Qwen 团队提交论文 Qwen-Planner-Agent(arXiv 2609.29892),抛出一个有点元的问题:AI 能不能既当被开发的对象,又当参与造下一代 AI 的活跃角色?他们给出的答案是一套闭环的 AI-for-AI 框架,并用「移动端规划智能体」这个极难的考场来逼出它的价值——移动规划任务长程、复杂,对可靠性要求高,而真机交互又贵又慢,传统开发很难规模化。
框架用一份「动作—反馈—验证」的共享契约,把数据生产、模型训练与部署串成闭环,分成三段发力。其一,AI for Data:用一个有人工把关的数据飞轮,让专门的智能体去构造任务、采集交互轨迹、整理并平衡训练数据,再用训练反馈指导下一轮数据生成。其二,AI for Training:以监督式规划冷启动,叠加混合环境的在线 agentic 强化学习;其中引入的 CARE(Competence-Aware Reward-and-Advantage Engineering)机制,目标是压低推理与工具调用成本,同时不掉任务表现。
第三段最特别:让模型与 harness 一起进化
其三,AI 驱动「模型—harness 协同进化」:一个由执行证据驱动的回路,在运行时编排记忆、技能与工具,并把结构化的动作反馈与保留下来的失败轨迹,反哺回模型与 harness 的协同适配。换句话说,不只是模型在学,包着模型的执行外壳(harness)也在根据真实跑出来的证据一起长。这正是它区别于「单纯训个大模型」的地方。
在 MobilePA-Bench 上,Qwen-Planner-Agent 在工具使用、记忆、技能与子智能体协作等维度,全面超过其基础模型;在若干非移动端的 agentic 基准上也有提升,且大体保住了通用能力。对一支要做端侧规划智能体的团队,这个信号很关键:把数据飞轮、训练策略与 harness 协同放进同一个闭环,或许比单点堆参数更能撬动真实场景的可靠性。
它和「程序图」不是一回事,别撞车
同期北大等提出的 Procedural Graphs(PG)也在讲「让 harness 自我进化」,但路径不同:PG 侧重把工具、技能、记忆连成一张带条件与避坑指引的程序图,偏静态结构;Qwen-Planner 侧重用 AI-for-AI 的闭环,让数据与训练反哺模型与 harness 共同演进,偏动态迭代。两者一个是「把经验画成图」,一个是「让经验滚成环」,互补空间大于竞争。当然,移动场景的真机成本、闭环里人工把关的尺度,仍是决定它能否走出论文的关键变量。
值得注意的是,闭环里「人工把关的数据飞轮」仍是关键阀门:完全放开让智能体自产自训,容易在放大能力的同时放大偏差与错误。Qwen-Planner 把人留在数据质量与训练反馈的环上,而不是把环彻底交给模型,这个分寸值得其他 AI-for-AI 尝试借鉴。对做端侧智能体的团队,真正可抄的是「飞轮 + 协同进化」的组合,而非追逐更大的底座。
对行业更大的意味在于:当「AI 造 AI」从愿景变成可工程化的框架,智能体研发本身的效率会被重写——数据不再全靠人标,训练不再单点调参,harness 也不再写死。值得持续观察它能否跨出移动端、在更通用的 agent 训练里复现这套闭环。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。