能力评测 2026-09-28 20 分钟阅读 进阶

Toolathlon-Verified 横评:604 个工具的大目录里,智能体的工具调用还剩几成把握

港科大「工具十项全能」的 Verified 版实测 — 为什么在真实应用的大目录里,开源权重模型能与旗舰模型同场竞速

摘要

当智能体接入了数百个应用、上千个工具,「选对工具」本身成了能力瓶颈。香港科技大学 NLP 实验室的 Toolathlon 基准把这个问题做成了考试:108 个任务、32 个真实应用、604 个工具,任务在预填真实数据的容器化应用里执行,由执行式检查器判定结果。2026 年 6 月 30 日发布的 Toolathlon-Verified 是其最终验证版。本文基于 9 月下旬的公开榜单与多份第三方报告,拆解其设计、量化排名与口径边界,并回答一个业界关心的问题:为什么在这个大目录考场里,开源权重模型能稳稳站住前排。

基准是什么:把「工具十项全能」搬进真实软件

Toolathlon(The Tool Decathlon,工具十项全能)来自香港科技大学 NLP 实验室,论文编号 arXiv 2510.25726,官网 toolathlon.xyz。它评测的不是「模型能不能答对工具调用参数」,而是「智能体能不能在真实软件环境里把事情办成」。三个设计选择让它与常见的函数调用基准明显不同:

规模上,官方 README 给出 600+ 工具;综合第三方榜单与评测报告,Verified 版本为 108 个任务、32 个应用、604 个工具。

Verified 版本:任务、判定与执行上限

2026 年 6 月 30 日,团队发布 Toolathlon-Verified:任务提示词、标准答案与评估器均经人工审核并对齐,这是对外可比的最终版本。同日,8 个模型的完整运行轨迹上传 HuggingFace 数据集供外部校验,7 月又补充了 Muse Spark 1.1 的轨迹。把轨迹数据集公开,在主流基准里并不多见——它让任何人可以逐轮回看模型是怎么一步步走偏的。

执行上限同样值得注意,这决定了榜单数字的含金量:

评测参数 设定 含义
单任务最长执行时间 5400 秒(90 分钟) 长程任务允许充分尝试,不会因超时过紧而普遍失分
单轮输出上限 64K tokens 显式指定 reasoning effort,防止单轮超长发挥掩盖规划缺陷
运行环境 每任务独立 Docker/Podman 容器 任务隔离、可并行(最多 10 个 worker)
判定方式 执行式检查器 + ground truths 核验产物与应用状态,非文本匹配

榜单横评:前五名与两个口径

下表为第三方评测聚合站 2026 年 9 月 24 日检索的 Toolathlon-Verified 榜单(Pass@1,标明 effort 档位):

排名 模型(effort) Pass@1 备注
1 GLM-5.3-Flash(max) 78.4% 开源权重
2 Kimi K3(max) 76.5% 开源权重
3 Claude Opus 4.8(max) 76.2% 与次名仅差 0.3 分
4 Muse Spark 1.2(xhigh) 75.9% 开源权重
5 DeepSeek V4 Pro 0813(max) 74.4% 开源权重

需要立刻给出第二个口径:聚合站 llm-stats 收录的小米 MiMo-V2.6 发布报告(自报口径)显示,Claude Opus 5.5 以 77.8% 位居其收录样本之首,MiMo-V2.6-Pro 为 76.9%、MiMo-V2.6-Flash 为 73.6%。两个口径的差异来自快照时间、收录样本与 effort 配置不同——它们不能直接互比,但共同指向一个结论:在 74%–78% 的区间里挤着开源与闭源的多个模型,头部差距收窄到个位数分差。另外要提醒,截至上述快照,Claude Opus 5/5.5(除 MiMo 自报口径外)、GPT-6 与 Gemini 3.8 Flash 尚未出现在官方榜单前列,榜单排位会随后续提交继续变化。

大目录难题:工具越多,选择越贵

Toolathlon 的核心变量是目录规模。604 个工具意味着智能体面对的不是「十选一」而是「数百选一」,且很多工具语义相近(都是「发消息」、都是「查记录」)。这类基准上反复出现一个规律:目录越大,准确率越低——模型在检索与甄别工具上的开销随目录增长而上升,错误往往不是「调用失败」,而是「调用了语义相近但错误的工具」,之后一路走偏。

🔍 对企业选型的直接含义

如果你的智能体平台接入了上百个 MCP 服务器,「模型够不够聪明」只是问题的一半;另一半是 harness 的工具检索与权限收敛设计——把无关工具从候选集里提前滤掉,往往比换一个更贵的模型更能提升端到端成功率。这也是为什么同一个模型在不同 harness 下的 Toolathlon 分数会有明显波动。

执行式判定还带来一个附带好处:想靠「输出看起来像完成了」骗过检查器基本不可能——检查器核验的是邮件真的发出去了、文件真的写对了位置。这在当前基准可信度普遍受质疑的环境下,是一种相对抗操纵的设计。

开源权重为什么能打

榜单前五里有四个开源权重模型,这是 Toolathlon-Verified 与许多闭源领先基准最大的气质差异。可能的解释有三层,注意前两层是推断而非实证:

  1. 任务性质偏向「程序性执行」:多步工具编排考验的是指令遵循、状态跟踪与纠错循环,这些能力可以通过针对工具使用的数据与训练重点补齐,而不完全依赖模型规模;
  2. 推理预算的作用:榜单上多数头部成绩出现在 max/xhigh effort 档位,说明充分的长思考对大目录甄别帮助显著——而 effort 预算是所有模型都能购买的;
  3. 工具调用生态的标准化:MCP 成为跨厂商事实标准后,训练数据里的工具调用模式趋同,缩小了闭源厂商在工具使用上的独占优势。

对企业用户的实际含义是:在重工具编排、轻深度推理的场景(运维、数据处理、跨应用流程自动化),开源权重模型加合格 harness 的组合,性价比已经相当能打;而在需要复杂推理与代码生成的场景,旗舰闭源模型的优势仍然明显——基准与基准之间不可互相外推。

与 MCP-Atlas、τ³-bench 的口径对照

2026 年的智能体工具评测形成了三个侧重不同的考场,数字互不可比,但合在一起能拼出较完整的图:

基准 规模 考察重点 代表性头部成绩(2026-09 快照)
Toolathlon-Verified 108 任务 / 32 应用 / 604 工具 大目录下的长程工具编排,执行式判定 GLM-5.3-Flash 78.4%(开源领跑)
MCP-Atlas(Scale AI) 1000 任务 / 36 个真实 MCP 服务器 / 220 工具 跨真实 MCP 服务器的工具使用,答案覆盖 75% 预期要点判过 Muse Spark 1.1 88.1%,前十名分差约 ±2 分近乎持平
τ³-bench(Sierra) 模拟客服对话 + 700 文档知识库 多轮工具调用中遵守业务策略(banking 域) Qwen 3.8 Max 55.2%,头部亦仅过半

三者放在一起读,有一条清晰的谱线:考「选对工具」时头部分数已经很高(MCP-Atlas 近乎持平),考「选对并按策略执行完」时分数显著下探(τ³-bank 55% 上下),大目录长程执行则落在中间。企业选型时应当先分清自己的场景更靠近哪一个考场。

局限与阅读建议

目前官方及行业暂未披露更多细节(如Verified 之后是否还有版本迭代、GPT-6 与 Opus 5.5 等旗舰的官方成绩何时提交),后续将持续跟进迭代动态。

核心发现

参考来源

  1. GitHub — hkust-nlp/Toolathlon 官方仓库 README 与 Toolathlon-Verified 发布记录(2026-06-30)
  2. arXiv 2510.25726 — The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
  3. Fleece AI — AI Agent Benchmarks 2026 Explained(2026-09-24 快照,Toolathlon-Verified/MCP-Atlas/τ³-bench 榜单数据)
  4. LLM Stats — Toolathlon-Verified 榜单页(MiMo-V2.6 发布自报口径)
  5. Anthropic 评测报告 — 对 Toolathlon-Verified 的采用与轨迹轮次统计(经公开 PDF 转述)