能力评测 2026-10-09 25 分钟阅读 进阶

Hermes Index 横评:当评测榜开始给每一分标价

Nous Research 四套件双指标快照 — Opus 5.5 居首、Astra 分数第二成本最高、Pareto 前沿上的六款模型

摘要

2026 年 10 月 6 日,开源实验室 Nous Research 上线 Hermes Index:14 款前沿模型在同一个 Hermes Agent Harness 内跑完四套智能体基准,每款模型同时给出两个数字——平均分与平均每任务成本。榜单结果本身有意思:Claude Opus 5.5 以 63.31 分居首、每任务 $4.99;GPT-6 Astra 分数第二(56.25)却是全榜最贵($11.61);真正的性价比故事发生在 Pareto 前沿的六款模型上。但比名次更重要的是方法论信号:当「每任务成本」成为与分数并列的栏位,模型选型的语言正在从「谁分高」转向「在我的任务量与预算下,哪条成本-质量曲线最适合」。本文拆解榜单构成、逐档解读数据,并给出这份榜单必须保留的几条口径保留意见。

榜单构成:一套 Harness、四套基准、两个指标

Hermes Index 的评测设定有三个关键约束,每一个都影响读数方式:

四套件中新加的 Hermes Bench 由 Nous 自建:150 个任务、覆盖 25 个场景类别,横跨技能(Skills)、研究(Research)、图表与创作、记忆(Memory)、工具使用(Tool Usage)与安全(Safety)。与常见「答题式」基准不同,智能体直接操作工作区与真实文件,评分依据是生成的文件、任务状态与工具调用日志——属于执行式判定,而非裁判模型打分。

📊 方法论信号

多数榜单只回答「谁分高」,Hermes Index 强制并列回答「这一分值多少钱」。当企业每天要跑数千至数万次智能体任务时,每任务成本直接进入预算模型——两个数字并排,本身就是对行业定价透明度的一次施压。

主榜单:分数与价格的完整快照

以下是官方发布、经多家媒体交叉确认的核心数据(部分数据官方仍标注为 provisional,属临时口径):

排名 模型 Hermes Index 平均分 平均每任务成本 注记
1 Claude Opus 5.5 63.31 $4.99 分数与价格的平衡点
2 GPT-6 Astra 56.25 $11.61 全榜最贵
3 Claude Sonnet 5.5 53.14 $2.82 中档 Pareto 选择
4 GPT-6 Sol 44.10 $2.23 Pareto 前沿
5 Grok 4.7 39.32 $10.77 价格与分数脱钩档
6 GLM-5.3 约 38 分档 低价位 国产模型表现居前(中文媒体口径)
9 DeepSeek V4.1 Flash 36.91 $0.259 低成本档 Pareto 前沿
— GPT-6 Luna 33.89 $0.141 Pareto 前沿
14 Ling 3.0 Flash 21.56 $0.054 极致低价档

三个最值得注意的落差:

Pareto 前沿:性价比选型的六款模型

Nous 官方标注了六款位于成本-性能 Pareto 前沿的模型:不存在另一款模型既更便宜又分数更高。这份名单本身就是榜单最有用的输出之一:

模型 平均分 每任务成本 前沿位置解读
Claude Opus 5.5 63.31 $4.99 质量上界——不追求极致低价时的默认上限
Claude Sonnet 5.5 53.14 $2.82 中档甜点——质量损失 10 分,价格省 43%
GPT-6 Sol 44.10 $2.23 中低价位独立选择
DeepSeek V4.1 Flash 36.91 $0.259 进入「美分级」成本区
GPT-6 Luna 33.89 $0.141 与 V4.1 Flash 分数接近、价格再省近一半
Ling 3.0 Flash 21.56 $0.054 成本下界——零预算/海量轻任务的保底选项

不在前沿上的模型也不是不能选——它们只是「在某个维度被支配」:要么有更便宜且更强的替代(如 Astra 之于 Opus 5.5),要么定位特殊(Grok 4.7 分数第五但成本 $10.77,仅在特定任务分布上才有选择理由)。

成本分档读法:三个价格带的三种决策

把 14 款模型按成本重新切分,比按排名读更接近实际采购视角:

价格带 代表模型 分数区间 适合的决策场景
旗舰带(>$4/任务) Opus 5.5($4.99)、Astra($11.61)、Grok 4.7($10.77) 39–63 高价值低频任务:复杂分析、难以重跑的长任务;Astra 与 Grok 需要论证「为什么不用 Opus」
中坚带($2–3/任务) Sonnet 5.5($2.82)、GPT-6 Sol($2.23) 44–53 日常生产主力:多数编码与办公智能体工作流的默认档
经济带(<$0.3/任务) DeepSeek V4.1 Flash($0.259)、GPT-6 Luna($0.141)、Ling 3.0 Flash($0.054) 22–37 高容量可容错任务:批量分类、格式转换、初筛;需配验证与降级路由

经济带的价格差值得单独算一笔账:Ling 3.0 Flash 与 Opus 5.5 的每任务成本相差约 92 倍。如果一个任务池里 80% 是简单任务、20% 是难任务,「经济带跑量 + 旗舰带兜底」的路由结构在数学上几乎是必然结论——问题只在于路由边界的划定,这正是各家「决策模型」与「模型路由」产品正在填充的空间。

与其他榜单的口径对照

Hermes Index 不是「又一个榜单」——它与已有评测体系的口径差异本身就构成信息:

维度 Hermes Index Terminal-Bench 4.0 AA Coding Agent Index
评测单元 模型(统一 Hermes Agent Harness) Agent + 模型组合(厂商自报) Agent + 模型组合(三基准等权)
成本披露 每任务平均成本,与分数并列 总运行成本披露,不与分数并排 不含成本维度
任务域 通用智能体(技能/研究/记忆/工具/安全 + 终端 + 科学) 终端编码任务 编码专项
发布方立场 Hermes 框架开发商(利益关联) 第三方学术团队 第三方评测机构
重试口径 pass@1 多试验统计(330 次试验) 各基准原生口径

对照中可以看到 Hermes Index 的独特位置:它是目前少数把成本做成与分数同级的一等指标的横评。但也要注意,统一自家 Harness 意味着这份榜单测的是「模型在 Hermes Agent 里的表现」——换一个 Harness,排序可能移动。本站 R-BENCH-28(Terminal-Bench 4.0 快照)已经实证过 harness 与模型的权重之辨:同一模型在不同脚手架里可以差出一个名次带。把 Hermes Index 当作「模型本身的横截面」读,比当作「产品的最终排名」读更安全。

口径保留意见与短板

给选型者的三步读法

  1. 先定任务分布,再看前沿:统计自己的任务池——多少比例是高难度、多少是批量简单任务。如果难任务占比不足两成,旗舰带的绝对分数对你意义有限,重点看中坚带与经济带的 Pareto 组合。
  2. 用成本乘数换算真实账单:每任务成本 × 日均任务量 × 22 个工作日,得到月度模型支出区间。Astra 与 Opus 5.5 的 2.3 倍价差,在日跑 5000 任务的团队里就是每月数万美元级别的分岔。
  3. 把榜单当横截面,不当终点:单一 Harness 的结果必须与你的实际 Harness 组合交叉验证。可执行的验证方式是拿榜单前三名与经济带两款,在你自己的 20 个真实任务上跑一轮双指标对比——你自己的「迷你 Hermes Index」比任何公开榜单都准。

目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

核心发现

参考来源

  1. Nous Research — Hermes Index 官方榜单页(2026.10.06)
  2. Prompt Engineering News / AlphaSignal — Nous Research's Hermes Index Ranks AI Agents by Score and Real Cost(2026.10.06)
  3. KuCoin News(转 BlockBeats)— Hermes 模型榜上线:Opus 5.5 居首,Astra 最贵(2026.10)
  4. AGI Hunt — Hermes Index scores: Opus 5.5 at $4.99/task leads, GPT-6 Astra costs $11.61(2026.10)
  5. AI Understanding — Nous Research launches Hermes Index to benchmark agentic AI models and costs(2026.10.07,含融资信息)
  6. 科技区角 — Hermes Index 发布大模型性价比榜单,国产模型表现抢眼(2026.10)