长程任务为何总在半路翻车

10 月 8 日挂上 arXiv 的一篇论文 TaReD,瞄准的是智能体最实际的痛点之一:长程任务里,把推理和行动交错在同一条执行链上,随着历史越积越长,中间依赖越来越难看清,早期规划的一点偏差会被一路放大。把复杂任务递归拆成小 subtask 是个自然的办法,但论文指出,有效的拆分必须考虑系统实际能用什么工具——而现实里工具库往往大到不可能一次性全塞进上下文:把每个工具描述都喂进去,既费 token,又让真正相关的工具更难被检索到,任务边界也更难划清。

TaReD 的思路是「工具感知」地拆。它把工具按功能关系组织成一层能力层级,执行时智能体按需去发现工具,再用这层层级把复杂任务递归拆成一棵子任务树,每一层的粒度跟该阶段需要的能力对齐。换句话说,不是上来就把全部工具摊开,而是先想清楚这一步要什么能力,再去对应的能力节点下取工具。

数字好看,但要看清边界

论文在若干复杂真实任务上的实验显示,端到端成功率较对比基线最高提升了 40 个百分点,代码也已开源。对工具繁多的智能体来说,这是个相当务实的改进方向:把「工具爆炸」从上下文负担变成可检索的结构,既省钱又提准。

不过也要泼点冷水。这套方法的下限,取决于能力层级本身设计得好不好、工具元数据的标注到不到位——层级分错了,拆出来的子树照样跑偏。而且它最受益的是能干净映射到能力分层的任务,对那些流程含糊、跨能力纠缠的工作,收益未必这么夸张。把它当作一个值得跟进的工程思路,而非万能钥匙,更稳妥。

工具太多塞不进上下文,就按能力分层能力层级:把工具按功能关系归到不同能力节点检索类计算类执行类通信类按需发现工具,递归拆成与能力对齐的子任务树复杂真实任务端到端成功率较基线最高 +40 个百分点
图|TaReD 把庞大的工具库按功能关系组织成能力层级,智能体在运行时按需发现工具,并把复杂任务递归拆成与所需能力对齐的子任务树,真实任务成功率较基线最高提升 40 个百分点。