基准是什么:把「工具十项全能」搬进真实软件
Toolathlon(The Tool Decathlon,工具十项全能)来自香港科技大学 NLP 实验室,论文编号 arXiv 2510.25726,官网 toolathlon.xyz。它评测的不是「模型能不能答对工具调用参数」,而是「智能体能不能在真实软件环境里把事情办成」。三个设计选择让它与常见的函数调用基准明显不同:
- 真实应用而非模拟 API:环境里跑的是 poste.io 邮件服务器、Canvas 教学平台、MinIO 对象存储等真实软件,通过 MCP 服务器接入智能体;
- 执行式判定而非字符串比对:每个任务预填真实数据,结束后由检查器核验「产物文件与相关应用里的状态变化」,而不是核对模型输出的文本;
- 长程多步:官方示例任务——自动检查邮箱里的作业并到 Canvas 上打分——需要跨多个应用的多步编排。据第三方评测报告转述,其评测运行中的轨迹平均约 20–26 个助手轮次。
规模上,官方 README 给出 600+ 工具;综合第三方榜单与评测报告,Verified 版本为 108 个任务、32 个应用、604 个工具。
Verified 版本:任务、判定与执行上限
2026 年 6 月 30 日,团队发布 Toolathlon-Verified:任务提示词、标准答案与评估器均经人工审核并对齐,这是对外可比的最终版本。同日,8 个模型的完整运行轨迹上传 HuggingFace 数据集供外部校验,7 月又补充了 Muse Spark 1.1 的轨迹。把轨迹数据集公开,在主流基准里并不多见——它让任何人可以逐轮回看模型是怎么一步步走偏的。
执行上限同样值得注意,这决定了榜单数字的含金量:
| 评测参数 | 设定 | 含义 |
|---|---|---|
| 单任务最长执行时间 | 5400 秒(90 分钟) | 长程任务允许充分尝试,不会因超时过紧而普遍失分 |
| 单轮输出上限 | 64K tokens | 显式指定 reasoning effort,防止单轮超长发挥掩盖规划缺陷 |
| 运行环境 | 每任务独立 Docker/Podman 容器 | 任务隔离、可并行(最多 10 个 worker) |
| 判定方式 | 执行式检查器 + ground truths | 核验产物与应用状态,非文本匹配 |
榜单横评:前五名与两个口径
下表为第三方评测聚合站 2026 年 9 月 24 日检索的 Toolathlon-Verified 榜单(Pass@1,标明 effort 档位):
| 排名 | 模型(effort) | Pass@1 | 备注 |
|---|---|---|---|
| 1 | GLM-5.3-Flash(max) | 78.4% | 开源权重 |
| 2 | Kimi K3(max) | 76.5% | 开源权重 |
| 3 | Claude Opus 4.8(max) | 76.2% | 与次名仅差 0.3 分 |
| 4 | Muse Spark 1.2(xhigh) | 75.9% | 开源权重 |
| 5 | DeepSeek V4 Pro 0813(max) | 74.4% | 开源权重 |
需要立刻给出第二个口径:聚合站 llm-stats 收录的小米 MiMo-V2.6 发布报告(自报口径)显示,Claude Opus 5.5 以 77.8% 位居其收录样本之首,MiMo-V2.6-Pro 为 76.9%、MiMo-V2.6-Flash 为 73.6%。两个口径的差异来自快照时间、收录样本与 effort 配置不同——它们不能直接互比,但共同指向一个结论:在 74%–78% 的区间里挤着开源与闭源的多个模型,头部差距收窄到个位数分差。另外要提醒,截至上述快照,Claude Opus 5/5.5(除 MiMo 自报口径外)、GPT-6 与 Gemini 3.8 Flash 尚未出现在官方榜单前列,榜单排位会随后续提交继续变化。
大目录难题:工具越多,选择越贵
Toolathlon 的核心变量是目录规模。604 个工具意味着智能体面对的不是「十选一」而是「数百选一」,且很多工具语义相近(都是「发消息」、都是「查记录」)。这类基准上反复出现一个规律:目录越大,准确率越低——模型在检索与甄别工具上的开销随目录增长而上升,错误往往不是「调用失败」,而是「调用了语义相近但错误的工具」,之后一路走偏。
如果你的智能体平台接入了上百个 MCP 服务器,「模型够不够聪明」只是问题的一半;另一半是 harness 的工具检索与权限收敛设计——把无关工具从候选集里提前滤掉,往往比换一个更贵的模型更能提升端到端成功率。这也是为什么同一个模型在不同 harness 下的 Toolathlon 分数会有明显波动。
执行式判定还带来一个附带好处:想靠「输出看起来像完成了」骗过检查器基本不可能——检查器核验的是邮件真的发出去了、文件真的写对了位置。这在当前基准可信度普遍受质疑的环境下,是一种相对抗操纵的设计。
开源权重为什么能打
榜单前五里有四个开源权重模型,这是 Toolathlon-Verified 与许多闭源领先基准最大的气质差异。可能的解释有三层,注意前两层是推断而非实证:
- 任务性质偏向「程序性执行」:多步工具编排考验的是指令遵循、状态跟踪与纠错循环,这些能力可以通过针对工具使用的数据与训练重点补齐,而不完全依赖模型规模;
- 推理预算的作用:榜单上多数头部成绩出现在 max/xhigh effort 档位,说明充分的长思考对大目录甄别帮助显著——而 effort 预算是所有模型都能购买的;
- 工具调用生态的标准化:MCP 成为跨厂商事实标准后,训练数据里的工具调用模式趋同,缩小了闭源厂商在工具使用上的独占优势。
对企业用户的实际含义是:在重工具编排、轻深度推理的场景(运维、数据处理、跨应用流程自动化),开源权重模型加合格 harness 的组合,性价比已经相当能打;而在需要复杂推理与代码生成的场景,旗舰闭源模型的优势仍然明显——基准与基准之间不可互相外推。
与 MCP-Atlas、τ³-bench 的口径对照
2026 年的智能体工具评测形成了三个侧重不同的考场,数字互不可比,但合在一起能拼出较完整的图:
| 基准 | 规模 | 考察重点 | 代表性头部成绩(2026-09 快照) |
|---|---|---|---|
| Toolathlon-Verified | 108 任务 / 32 应用 / 604 工具 | 大目录下的长程工具编排,执行式判定 | GLM-5.3-Flash 78.4%(开源领跑) |
| MCP-Atlas(Scale AI) | 1000 任务 / 36 个真实 MCP 服务器 / 220 工具 | 跨真实 MCP 服务器的工具使用,答案覆盖 75% 预期要点判过 | Muse Spark 1.1 88.1%,前十名分差约 ±2 分近乎持平 |
| τ³-bench(Sierra) | 模拟客服对话 + 700 文档知识库 | 多轮工具调用中遵守业务策略(banking 域) | Qwen 3.8 Max 55.2%,头部亦仅过半 |
三者放在一起读,有一条清晰的谱线:考「选对工具」时头部分数已经很高(MCP-Atlas 近乎持平),考「选对并按策略执行完」时分数显著下探(τ³-bank 55% 上下),大目录长程执行则落在中间。企业选型时应当先分清自己的场景更靠近哪一个考场。
局限与阅读建议
- 榜单口径动态变化:官方榜单持续接受提交,本文引用的快照截至 2026-09-24,头部排位与未上榜旗舰(Opus 5.5、GPT-6、Gemini 3.8 Flash 等)的后续成绩可能改写结论;MiMo-V2.6 的数字为厂商发布自报,未经独立复核。
- 任务域集中在办公与运营:32 个应用以办公自动化、电商运营、数据分析与网络调研为主,对工业控制、金融交易等强合规域的代表性有限。
- 开源领先是「当前快照」而非「结构优势」:头部闭源旗舰尚未全部入榜,四个开源模型进前五的格局未必稳定,不宜写成定论。
- 执行上限宽松的两面性:90 分钟上限让长程任务有充分时间,但也意味着分数里包含「算力换成功率」的成分——成本维度需要另外核算。
目前官方及行业暂未披露更多细节(如Verified 之后是否还有版本迭代、GPT-6 与 Opus 5.5 等旗舰的官方成绩何时提交),后续将持续跟进迭代动态。