9 月 24 日,Qwen 团队提交论文 Qwen-Planner-Agent(arXiv 2609.29892),抛出一个有点元的问题:AI 能不能既当被开发的对象,又当参与造下一代 AI 的活跃角色?他们给出的答案是一套闭环的 AI-for-AI 框架,并用「移动端规划智能体」这个极难的考场来逼出它的价值——移动规划任务长程、复杂,对可靠性要求高,而真机交互又贵又慢,传统开发很难规模化。

框架用一份「动作—反馈—验证」的共享契约,把数据生产、模型训练与部署串成闭环,分成三段发力。其一,AI for Data:用一个有人工把关的数据飞轮,让专门的智能体去构造任务、采集交互轨迹、整理并平衡训练数据,再用训练反馈指导下一轮数据生成。其二,AI for Training:以监督式规划冷启动,叠加混合环境的在线 agentic 强化学习;其中引入的 CARE(Competence-Aware Reward-and-Advantage Engineering)机制,目标是压低推理与工具调用成本,同时不掉任务表现。

第三段最特别:让模型与 harness 一起进化

其三,AI 驱动「模型—harness 协同进化」:一个由执行证据驱动的回路,在运行时编排记忆、技能与工具,并把结构化的动作反馈与保留下来的失败轨迹,反哺回模型与 harness 的协同适配。换句话说,不只是模型在学,包着模型的执行外壳(harness)也在根据真实跑出来的证据一起长。这正是它区别于「单纯训个大模型」的地方。

用一份契约把数据、训练、harness 串成闭环 AI for Data · 智能体造任务 · 采轨迹、整数据 · 反馈指导下一轮 · 人工把关飞轮 AI for Training · 规划冷启动 · 在线 agentic RL · CARE 控成本 · 保住表现 模型—harness · 运行时编排 · 记忆技能工具 · 失败轨迹反哺 · 协同进化 三者共享「动作—反馈—验证」契约,循环迭代
图 1|数据飞轮、训练策略与执行外壳一起进化,而非只训大模型

在 MobilePA-Bench 上,Qwen-Planner-Agent 在工具使用、记忆、技能与子智能体协作等维度,全面超过其基础模型;在若干非移动端的 agentic 基准上也有提升,且大体保住了通用能力。对一支要做端侧规划智能体的团队,这个信号很关键:把数据飞轮、训练策略与 harness 协同放进同一个闭环,或许比单点堆参数更能撬动真实场景的可靠性。

它和「程序图」不是一回事,别撞车

同期北大等提出的 Procedural Graphs(PG)也在讲「让 harness 自我进化」,但路径不同:PG 侧重把工具、技能、记忆连成一张带条件与避坑指引的程序图,偏静态结构;Qwen-Planner 侧重用 AI-for-AI 的闭环,让数据与训练反哺模型与 harness 共同演进,偏动态迭代。两者一个是「把经验画成图」,一个是「让经验滚成环」,互补空间大于竞争。当然,移动场景的真机成本、闭环里人工把关的尺度,仍是决定它能否走出论文的关键变量。

全面超过基础模型,且保住通用能力 工具使用 记忆 技能 子智能体 均优于基础模型 维度全面领先 协同更强 非移动端亦提升 基准仅反映能力维度,真实可靠性仍看端侧部署
图 2|闭环带来的不是单点分数,而是多维度的一致提升

值得注意的是,闭环里「人工把关的数据飞轮」仍是关键阀门:完全放开让智能体自产自训,容易在放大能力的同时放大偏差与错误。Qwen-Planner 把人留在数据质量与训练反馈的环上,而不是把环彻底交给模型,这个分寸值得其他 AI-for-AI 尝试借鉴。对做端侧智能体的团队,真正可抄的是「飞轮 + 协同进化」的组合,而非追逐更大的底座。

对行业更大的意味在于:当「AI 造 AI」从愿景变成可工程化的框架,智能体研发本身的效率会被重写——数据不再全靠人标,训练不再单点调参,harness 也不再写死。值得持续观察它能否跨出移动端、在更通用的 agent 训练里复现这套闭环。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。