智能体要采购、要上生产、要过监管,绕不开一件事:打分。谁的 benchmark 高就买谁,哪个安全基准过了就放行。两项由 Stanford HAI 支持的研究,在 10 月 5 日前后把这个前提泼了冷水:我们用来给模型排名、采购、监管的那些分数,很多根本没有量对东西。其中一项(arXiv 2609.08812)把心理测量学里成熟的“聚合效度”与“区分效度”方法搬来,检验了 56 个能力与安全基准、53 个模型。

安全基准彼此弱相关

研究发现,被贴上同一“安全”概念标签的不同基准,模型在它们之间的排名往往只是弱相关。换句话说,一个模型在 A 安全基准上排前,换到同属“安全”的 B 基准上未必还靠前。这说明“安全”这个词在不同基准里被定义成了并不一致的东西——你以为在比同一项能力,其实比的是两套标准。这对企业采购和监管都是直接隐患:依据某一把尺子放行,换把尺子结论可能翻盘。更棘手的是,这种不一致并非偶发噪声,而是在多个被广泛引用的公开基准上稳定复现的,它意味着“安全分高”本身并不携带可跨场景迁移的承诺。

安全基准 A拒答类安全基准 B越权类弱相关 ↔“偏差”基准更像推理与“推理”基准相关更强能力基准推理能力基准知识分不开 →设计伪影主导信号56 个基准 / 53 个模型:概念相同,排名却常常不强相关
图 1|基准互不买账:同叫“安全”的基准弱相关,而“偏差”反而更像“推理”,设计伪影盖过真信号

能力基准分不清推理与知识

能力侧的问题更微妙。研究给“推理”“知识”“拒答”等概念重新标定后,发现很多标着“推理”的基准,和标着“知识”的基准之间的相关性,并不比它们和别的完全不同概念的基准更强。也就是说,这些分数没能稳定区分“真的在推理”和“只是记住了知识”。如果采购时拿“推理分高”当卖点,而分数本身分不清推理与知识,这个卖点就站不住脚。

设计伪影盖过真信号

更扎心的一点是设计伪影:有些基准之所以彼此相关,不是因为测了同一个能力,而是因为它们用了相似的呈现形式(比如同样的分数格式、同样的题型)。论文举了个例子,“偏差”基准和“推理”基准的相关性,反而强过它和自己同类的“偏差”基准——纯粹因为表面形式更像。这意味着榜单上的相关性,可能大量来自出题方式,而非模型真实能力。

效度不是玄学,是可被检验的属性

值得一提的是,这项研究并非只泼冷水。它把心理测量学里成体系的检验流程搬进 AI 评测,等于给出了一张可操作的“体检表”:一个基准如果和它在概念上应当相关的其他基准相关性很弱,反而和八竿子打不着的基准更近,那它的效度就该被打上问号。换句话说,“这个基准到底测没测到它声称的东西”是一个可以定量回答的问题,而不是靠作者一句声明就过关。对行业而言,这比单纯争论谁的分数高更有建设性——它把“评测质量”本身变成了可以审计、可以比较的对象,也让采购方有了除排行榜之外的第二条依据。

对采购与监管意味着什么

把三件事叠起来看,结论不复杂但刺耳:我们依赖的分数,在“量什么”这一步就未必可靠;即使某一基准内部一致,跨基准也不迁移;而就算终点答对了,路径也可能违规(这一点近期过程级评测研究也有印证)。靠单个高分数做“买谁、限谁”的决策,地基并不牢。论文给出的建议不是废除基准,而是要求每个基准公开它到底测了什么、置信区间落在哪、和哪些其他基准做过交叉验证。把这些当成采购文档的一部分,比只看排行榜末位更有意义。

采购 / 监管看分数决策分数不可靠没量对东西① 基准互不相关② 跨基准不迁移③ 终点对≠路径安全三重失灵叠加尺子本身量不准跨基准还漂终点对也别全信
图 2|评测三重失灵:采购监管依赖的分数不可靠、跨基准不迁移、终点正确也未必安全

不是否定评测,是要换把尺子

需要说清的是,这些研究不是在说“别评测了”,而是指出当前评测的 validity(效度)被长期忽视。作者们把完整的模型输出与分数在条目级和基准级都公开了出来,本意是推进行业补上“基准到底测了什么”这一课。对做智能体平台、做企业采购、做监管的人,更务实的动作是:少看单一总分,多看基准到底测了哪一层能力、有没有跨基准交叉验证、生产环境里是否还有过程级监控兜底。评测不会消失,但它该从“一个数字定生死”退回到“一组证据里的一项”。