2026 年 9 月,来自上海交通大学、新加坡管理大学等机构的论文 EarlyEval 直击一个很多团队心照不宣却很少挑明的话题:智能体评测,可能比模型本身还烧钱。论文给出的账很具体——在 SWE-bench Verified 这个业内常用的软件修复评测集上,让一个顶尖大模型完整跑完 500 道修复题,光模型调用费就要约 487 美元;如果换成更复杂的多模态评测,要求智能体读图、写代码、调工具、边推理边操作终端,单次评测成本直接飙到约 2236 美元。这还只是「交一次卷」的价格。当一个团队把评测当成日常、而不是偶尔为之时,这笔账会从一次性的开销,变成每月都在发生的固定负担。

一笔硬账:评测成本随重试指数式放大

真实研发哪有只交一次卷。改一行提示词、换一个记忆模块、调整一次工具调用顺序,往往都要把评测重跑一遍。一个迭代周期测 30 次,账单轻松突破 7 万美元。这背后的原因,是智能体根本不是答题机器,而是一个「数字实习生」:修一个真实仓库里的 bug,它要 clone 代码、读 17 个文件、跑测试、定位到第 329 行、写脚本复现、改逻辑、再跑测试——整个过程平均 45 步,每一步都要调用一次大模型。步骤越多,账单越像雪球滚下悬崖。

一笔硬账:评测比模型本身还烧钱 SWE-bench V 500 题完整跑 模型调用费 约 487 美元 多模态评测 单次更复杂任务 读图写码调工具 约 2236 美元 迭代 30 次 改一处重跑一遍 账单轻松破 7 万美元 智能体平均 45 步,每步调用一次大模型——像请一位年薪百万的工程师每敲一次回车付一次咨询费 评测经济学正在成为智能体研发的真实门槛 为什么贵:智能体不是答题机,是数字实习生 修一个真实 bug 要 clone、读 17 个文件、跑测试、定位、改、再测——步骤越多账单越像雪球
图 1|智能体评测的成本随重试次数指数式放大,单次完整跑就可能烧掉上千美元

也正因为此,评测的瓶颈正在从「算力卡脖子」悄悄换成「评测经济学卡脖子」。过去学界想省钱,主打一个「精简题库」:从 500 题里挑出 50 道代表题,测完再 extrapolate 全量分数。这招管用,但治标不治本——就像抽查 20 份作业判断班级水平,很聪明;可如果这 20 份作业每份都要手抄三遍、逐字批注五轮,省下的纸张根本抵不过多耗的墨水。

EarlyEval 的切口:给评测装「提前下课铃」

EarlyEval 不造新模型,也不换基准,而是干了一件更务实的事:给评测过程装一个「提前下课铃」。它的核心观察是,很多失败轨迹从早期信号就能判断走不通,继续跑下去只是白白消耗 token 和时间。与其等智能体把一条死路走完,不如在仍可信的前提下尽早终止明显失败的轨迹,把预算留给更有希望的路径。这相当于把评测从「每道题都跑满」变成「该停就停」,在不牺牲评估可信度的前提下压低总成本。

两种省钱思路:抽题 vs 提前下课 基准蒸馏(旧) 从 500 题里挑 50 道代表 测完 extrapolate 全量分 省了纸张,抵不过多耗的墨水 每道题仍可能重跑多轮 EarlyEval(新) 给评测装「提前下课铃」 尽早终止明显失败轨迹 在仍可信前提下省 token 不重新发明基准 论文来自上海交通大学、新加坡管理大学等机构,属评测工程优化,不改基准本身 评测的瓶颈正从算力卡脖子,转向「评测经济学」卡脖子
图 2|EarlyEval 不抽题、不换基准,而是在评测过程中更早地识别并终止失败轨迹

这种做法的妙处在于,它和基准蒸馏是互补而非替代:抽题解决「测哪些」,提前终止解决「每道测多久」。两者叠加,评测账单才有机会真正降下来。对中小团队尤其友好——它们没有大厂那样充裕的算力预算,却同样要做模型选型、提示词迭代与回归测试,EarlyEval 这类工程化优化,比又大又贵的基准更贴近它们的真实痛点。这也提醒行业,评测优化的空间往往不在模型侧,而在流程侧。

评测经济学正在成为新门槛

把视野拉远一点,EarlyEval 指向的是一个更宽的趋势:智能体研发的隐形门槛,正从模型能力转向评测成本。当模型迭代越来越快、可选模型越来越多,决定一个团队能试多少种方案的,往往不是谁的模型更聪明,而是谁能以更低成本把每一种方案评测清楚。评测框架、早停策略、轨迹压缩、预算分配,这些听起来不如新模型性感的工程问题,正在变成智能体落地的真实约束。对不少中小团队而言,评测账单甚至可能比推理账单更先触顶——他们的试错预算有限,却要覆盖同样多的模型与配置组合。这篇论文以 arXiv 预印本形式公开,具体编号以 arXiv 页面为准,后续将持续跟进迭代动态。