一句话:先别问 agent 聪不聪明,问它走的路费不费
9 月 15 日更新的论文 ZebraArena(arXiv 2603.18614)来自斯坦福、华盛顿大学等机构的研究者,它造了一个「诊断室」而非又一个跑分场:程序化生成任务、难度可控、知识最小化,专门用来研究工具增强大模型里「推理与行动」的耦合关系。
结论读起来有点扎心:即便是 GPT-5 与 Gemini 2.5 Pro 这个级别的前沿推理模型,在困难实例上的准确率也只有约六成;而 GPT-5 的工具调用次数,比理论最优值多出七成到两倍多。题不是不会做——是路走得实在太费。
为什么要造一个「干净」的环境
现有基准有个老大难问题:成绩没法干净归因。一个模型答错了,可能是推理不行,可能是压根背过这道题(记忆化),可能是题库混进了训练语料(数据污染),也可能是环境动态太复杂,失败原因搅成一团。多数基准把这四种情况混在一起算总分。
ZebraArena 的解法是三道设计闸门。其一,程序化生成加难度可控:任务由程序产出,难度参数可调,固定题库被反复刷题的路径被堵死。其二,知识最小化:每道题需要的关键信息只能通过针对性的工具调用获取,靠背题拿不到分——这把「记住了什么」从评测里剥离,剩下的就是「推理加行动」的纯能力。其三,单一确定解加确定性评分:每道题有且只有一条正确路径,同时论文给出理论最优查询次数,作为效率的标尺。
准确率六成:卡在哪一步
测试设计的关键在于,任务把「外部信息获取」与「演绎推理」拆成清晰的两段:先调工具拿到关键信息,再据此推出答案。分数低,可以追问到底卡在哪一段。
从结果看,困难实例上的瓶颈并不只是「推理跟不上」,还包括「何时调用、调哪个、调几次」的行动决策。这个区分在工程上很重要:如果是推理短板,换更强模型就能缓解;如果是行动决策的短板——比如不知道某信息需要调工具才能获得,或者调完一次就急着下结论——那换模型的效果就有限,得靠 harness 与提示工程来补。ZebraArena 的价值正在于此:它把这道耦合放到了可解释的显微镜下,而不是给你一个笼统的总分。
效率账:七成到两倍多的浪费从哪来
比准确率更有意思的是效率刻度。理论最优查询次数给了每一道题一条「最短路径」,而实测里 GPT-5 的调用次数稳定超出这条路径——下限约七成,上限能到两倍多。浪费的来源大致有三类:其一,冗余调用,同一条信息反复去取;其二,试错式调用,先猜再调,错了再调;其三,探索式调用,把工具当搜索引擎漫无目的地翻。
这份账单对生产环境的含义很直接。agent 的调用次数直接对应 token 成本、延迟与出错概率——在按调用量计费的时代,效率差距就是真金白银。目前绝大多数基准不报这组数字,排行榜上的「完成任务」掩盖了「完成任务的方式」。ZebraArena 把「理论最优」作为坐标轴画了出来,让「怎么完成的」有了一根可比的刻度——这一步对评测方法论的意义,不亚于分数本身。
给评测与工程的启示
对做 agent 评测的团队,这篇论文示范了一个方向:与其继续堆任务数量,不如把混杂变量一个个关掉——知识最小化堵记忆化,程序生成堵数据污染,单一确定解堵评分模糊。评测的公信力来自归因的干净程度。
对做 agent 的工程团队,两个可操作的启示:其一,把「工具调用效率」纳入内部验收指标,同一任务跑多模型,记录调用次数分布而不仅仅是成功率——那里面藏着一整个成本优化空间;其二,针对「不知道要调工具」这类失败,值得在提示与 harness 里显式教模型「哪些信息必须外取」——这比指望下一代模型自己想通,见效更快。理论最优与实际调用之间的那条缝,短期内不会自己合上,能管理它的团队,成本曲线会先降下来。