榜单构成:一套 Harness、四套基准、两个指标
Hermes Index 的评测设定有三个关键约束,每一个都影响读数方式:
- 统一 Harness:所有 14 款模型都在 Nous 自家的 Hermes Agent 框架内运行,任务经由同一个智能体运行时分发。模型之间的差异被隔离在「模型本身」,而不是「各家脚手架的工程质量」。
- 统一解码设定:pass@1(每任务一次尝试),推理强度在模型支持时统一设为 high。不比多次重试后的上限,只比一次过。
- 四套件平均:Hermes Bench、Terminal-Bench 4、Terminal-Bench Science、SkillsBench 四套基准的平均分,同时平均每任务成本。
四套件中新加的 Hermes Bench 由 Nous 自建:150 个任务、覆盖 25 个场景类别,横跨技能(Skills)、研究(Research)、图表与创作、记忆(Memory)、工具使用(Tool Usage)与安全(Safety)。与常见「答题式」基准不同,智能体直接操作工作区与真实文件,评分依据是生成的文件、任务状态与工具调用日志——属于执行式判定,而非裁判模型打分。
多数榜单只回答「谁分高」,Hermes Index 强制并列回答「这一分值多少钱」。当企业每天要跑数千至数万次智能体任务时,每任务成本直接进入预算模型——两个数字并排,本身就是对行业定价透明度的一次施压。
主榜单:分数与价格的完整快照
以下是官方发布、经多家媒体交叉确认的核心数据(部分数据官方仍标注为 provisional,属临时口径):
| 排名 | 模型 | Hermes Index 平均分 | 平均每任务成本 | 注记 |
|---|---|---|---|---|
| 1 | Claude Opus 5.5 | 63.31 | $4.99 | 分数与价格的平衡点 |
| 2 | GPT-6 Astra | 56.25 | $11.61 | 全榜最贵 |
| 3 | Claude Sonnet 5.5 | 53.14 | $2.82 | 中档 Pareto 选择 |
| 4 | GPT-6 Sol | 44.10 | $2.23 | Pareto 前沿 |
| 5 | Grok 4.7 | 39.32 | $10.77 | 价格与分数脱钩档 |
| 6 | GLM-5.3 | 约 38 分档 | 低价位 | 国产模型表现居前(中文媒体口径) |
| 9 | DeepSeek V4.1 Flash | 36.91 | $0.259 | 低成本档 Pareto 前沿 |
| — | GPT-6 Luna | 33.89 | $0.141 | Pareto 前沿 |
| 14 | Ling 3.0 Flash | 21.56 | $0.054 | 极致低价档 |
三个最值得注意的落差:
- Opus 5.5 vs Astra:分数高 7.06 分,成本却不到一半。这是整份榜单最刺眼的一组对照——「旗舰定价」与「旗舰表现」在这份快照里并不重合。
- Sonnet 5.5 的中间位:53.14 分拿到榜单约八成的分数质量,价格约为 Astra 的四分之一。对多数非极端难度的任务流,这一档是典型的「够用且便宜」。
- Flash 系的量级差:DeepSeek V4.1 Flash($0.259)与 Ling 3.0 Flash($0.054)的成本比 Opus 低一个到两个数量级,代价是分数落到 37 分与 22 分档——适合高容量、低复杂度、可容错的任务池。
Pareto 前沿:性价比选型的六款模型
Nous 官方标注了六款位于成本-性能 Pareto 前沿的模型:不存在另一款模型既更便宜又分数更高。这份名单本身就是榜单最有用的输出之一:
| 模型 | 平均分 | 每任务成本 | 前沿位置解读 |
|---|---|---|---|
| Claude Opus 5.5 | 63.31 | $4.99 | 质量上界——不追求极致低价时的默认上限 |
| Claude Sonnet 5.5 | 53.14 | $2.82 | 中档甜点——质量损失 10 分,价格省 43% |
| GPT-6 Sol | 44.10 | $2.23 | 中低价位独立选择 |
| DeepSeek V4.1 Flash | 36.91 | $0.259 | 进入「美分级」成本区 |
| GPT-6 Luna | 33.89 | $0.141 | 与 V4.1 Flash 分数接近、价格再省近一半 |
| Ling 3.0 Flash | 21.56 | $0.054 | 成本下界——零预算/海量轻任务的保底选项 |
不在前沿上的模型也不是不能选——它们只是「在某个维度被支配」:要么有更便宜且更强的替代(如 Astra 之于 Opus 5.5),要么定位特殊(Grok 4.7 分数第五但成本 $10.77,仅在特定任务分布上才有选择理由)。
成本分档读法:三个价格带的三种决策
把 14 款模型按成本重新切分,比按排名读更接近实际采购视角:
| 价格带 | 代表模型 | 分数区间 | 适合的决策场景 |
|---|---|---|---|
| 旗舰带(>$4/任务) | Opus 5.5($4.99)、Astra($11.61)、Grok 4.7($10.77) | 39–63 | 高价值低频任务:复杂分析、难以重跑的长任务;Astra 与 Grok 需要论证「为什么不用 Opus」 |
| 中坚带($2–3/任务) | Sonnet 5.5($2.82)、GPT-6 Sol($2.23) | 44–53 | 日常生产主力:多数编码与办公智能体工作流的默认档 |
| 经济带(<$0.3/任务) | DeepSeek V4.1 Flash($0.259)、GPT-6 Luna($0.141)、Ling 3.0 Flash($0.054) | 22–37 | 高容量可容错任务:批量分类、格式转换、初筛;需配验证与降级路由 |
经济带的价格差值得单独算一笔账:Ling 3.0 Flash 与 Opus 5.5 的每任务成本相差约 92 倍。如果一个任务池里 80% 是简单任务、20% 是难任务,「经济带跑量 + 旗舰带兜底」的路由结构在数学上几乎是必然结论——问题只在于路由边界的划定,这正是各家「决策模型」与「模型路由」产品正在填充的空间。
与其他榜单的口径对照
Hermes Index 不是「又一个榜单」——它与已有评测体系的口径差异本身就构成信息:
| 维度 | Hermes Index | Terminal-Bench 4.0 | AA Coding Agent Index |
|---|---|---|---|
| 评测单元 | 模型(统一 Hermes Agent Harness) | Agent + 模型组合(厂商自报) | Agent + 模型组合(三基准等权) |
| 成本披露 | 每任务平均成本,与分数并列 | 总运行成本披露,不与分数并排 | 不含成本维度 |
| 任务域 | 通用智能体(技能/研究/记忆/工具/安全 + 终端 + 科学) | 终端编码任务 | 编码专项 |
| 发布方立场 | Hermes 框架开发商(利益关联) | 第三方学术团队 | 第三方评测机构 |
| 重试口径 | pass@1 | 多试验统计(330 次试验) | 各基准原生口径 |
对照中可以看到 Hermes Index 的独特位置:它是目前少数把成本做成与分数同级的一等指标的横评。但也要注意,统一自家 Harness 意味着这份榜单测的是「模型在 Hermes Agent 里的表现」——换一个 Harness,排序可能移动。本站 R-BENCH-28(Terminal-Bench 4.0 快照)已经实证过 harness 与模型的权重之辨:同一模型在不同脚手架里可以差出一个名次带。把 Hermes Index 当作「模型本身的横截面」读,比当作「产品的最终排名」读更安全。
口径保留意见与短板
- 发布方利益关联:Hermes Index 由 Nous Research 出品,评测对象跑在自家 Hermes Agent 框架内,且榜单上线次日(10 月 7 日)Nous 宣布完成 9000 万美元融资(Nvidia 与微软 M12 参与,累计融资约 1.6 亿美元,估值 15 亿美元,Hermes 技术保持 MIT 开源)。榜单公信力与融资叙事同期发布,读者应把两者视为同一市场动作的两面。
- 部分数据 provisional:官方明确标注部分分数与成本为临时口径,后续快照可能修订。引用时建议保留日期戳。
- SkillsBench 仓库泄漏:Nous 自己披露 SkillsBench 存在仓库泄漏问题,受影响模型给出 clean 与 raw 双分。一个基准组件带已知污染,四套件平均的含金量需要打折看待。
- GLM-5.3 排名口径:国产模型名次主要来自中文媒体转述,官方页面未直接确认具体名次与分数,本文仅以区间方式呈现。
- 快照会漂移:模型价格与版本快速迭代(同期 Ling 3.1 Flash 已有跑分超过 V4.1 Flash 的报道),任何横评都是时点数据。
给选型者的三步读法
- 先定任务分布,再看前沿:统计自己的任务池——多少比例是高难度、多少是批量简单任务。如果难任务占比不足两成,旗舰带的绝对分数对你意义有限,重点看中坚带与经济带的 Pareto 组合。
- 用成本乘数换算真实账单:每任务成本 × 日均任务量 × 22 个工作日,得到月度模型支出区间。Astra 与 Opus 5.5 的 2.3 倍价差,在日跑 5000 任务的团队里就是每月数万美元级别的分岔。
- 把榜单当横截面,不当终点:单一 Harness 的结果必须与你的实际 Harness 组合交叉验证。可执行的验证方式是拿榜单前三名与经济带两款,在你自己的 20 个真实任务上跑一轮双指标对比——你自己的「迷你 Hermes Index」比任何公开榜单都准。
目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。