长程任务为何总在半路翻车
10 月 8 日挂上 arXiv 的一篇论文 TaReD,瞄准的是智能体最实际的痛点之一:长程任务里,把推理和行动交错在同一条执行链上,随着历史越积越长,中间依赖越来越难看清,早期规划的一点偏差会被一路放大。把复杂任务递归拆成小 subtask 是个自然的办法,但论文指出,有效的拆分必须考虑系统实际能用什么工具——而现实里工具库往往大到不可能一次性全塞进上下文:把每个工具描述都喂进去,既费 token,又让真正相关的工具更难被检索到,任务边界也更难划清。
TaReD 的思路是「工具感知」地拆。它把工具按功能关系组织成一层能力层级,执行时智能体按需去发现工具,再用这层层级把复杂任务递归拆成一棵子任务树,每一层的粒度跟该阶段需要的能力对齐。换句话说,不是上来就把全部工具摊开,而是先想清楚这一步要什么能力,再去对应的能力节点下取工具。
数字好看,但要看清边界
论文在若干复杂真实任务上的实验显示,端到端成功率较对比基线最高提升了 40 个百分点,代码也已开源。对工具繁多的智能体来说,这是个相当务实的改进方向:把「工具爆炸」从上下文负担变成可检索的结构,既省钱又提准。
不过也要泼点冷水。这套方法的下限,取决于能力层级本身设计得好不好、工具元数据的标注到不到位——层级分错了,拆出来的子树照样跑偏。而且它最受益的是能干净映射到能力分层的任务,对那些流程含糊、跨能力纠缠的工作,收益未必这么夸张。把它当作一个值得跟进的工程思路,而非万能钥匙,更稳妥。