Hermes Index(智能体模型指数)
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 14 分钟 |
| 更新时间 | 📅 2026-10-12 |
| 条目编号 | ENC-BENCH-20-hermes-index |
关键要点 ✦
- 2026 年 10 月 6 日上线,创刊号评测 14 个前沿模型;指标设计为双维度:四套件平均分衡量任务表现,单任务平均成本衡量经济性,两者并列呈现(据 Crypto Briefing 等报道)
- 核心自建套件为 Hermes Bench:150 个任务、覆盖 25 个类别;同时纳入 Terminal-Bench 4.0 与 SkillsBench 等既有评测,全部任务经 Nous 自研的 Hermes Agent 评测 harness(2026 年 2 月 25 日启动)运行
- 创刊号排名快照:Claude Opus 5.5 以 63.31 分居首、单任务均价 4.99 美元;GPT-6 Astra 56.25 分、11.61 美元(约为前者两倍多);Claude Sonnet 5.5 以 53.14 分、2.82 美元占据性价比位;DeepSeek V4.1 Flash 36.91 分、0.259 美元;Ling 3.0 Flash 21.56 分、0.054 美元
- 口径局限需明确:所有分数在 Nous 自家 Hermes Agent harness 内测得,模型在其他 harness 或真实部署中的表现可能不同;榜单官方也提示结果应作为一种观察视角而非普遍结论
- 发布次日(10 月 7 日)Nous Research 宣布获得 9,000 万美元新融资,累计融资约 1.6 亿美元、估值 15 亿美元,投资方包括 Nvidia 与微软 M12;核心框架维持 MIT 许可开源
- 由商业化同一框架的公司给全行业排名存在利益张力,引用分数时建议结合多个独立榜单交叉验证
为什么需要表现与成本双维度
传统模型榜单只回答「谁分数高」,但智能体的商业现实是按任务付费:一家每天跑数千个智能体任务的企业,关心的不是高出两分,而是每分背后的账单。两个任务成本相差数倍的模型,可能在总分接近时代表完全不同的采购决策。
据 Crypto Briefing 对发布信息的整理,Hermes Index 的指标设计直接回应这一现实:它测量模型作为智能体在 Hermes Agent 框架内的表现,同时跟踪每个任务的实际运行成本,榜单同时给出平均分与单任务均价。这使「性价比位」成为榜单的显性信息——例如创刊号中 Claude Sonnet 5.5 以约一半的分数差距换来约一半的成本,而 GPT-6 Astra 的高分伴随翻倍以上的单价。
这一思路与本站智能体定价词条讨论的行业趋势一致:当智能体商业模式向按任务量计费迁移,评测口径也必然从「能力单维度」走向「能力与成本的双维度」。
构成:Hermes Bench 与既有套件的组合
据发布报道,Hermes Index 由四套测试套件平均而成。核心是自建的 Hermes Bench:150 个任务、覆盖 25 个类别,任务设计强调与用户意图对齐。此外纳入了 Terminal-Bench 4.0(终端操作,见本站词条)与 SkillsBench 等既有评测,形成通用任务与专项能力的组合。
所有评测统一经 Hermes Agent 运行。Hermes Agent 是 Nous Research 于 2026 年 2 月 25 日启动的评测 harness,定位为聚焦用户对齐表现的智能体运行环境。统一 harness 的好处是横向可比——同一运行环境下 14 个模型的分数与成本可直接对照;代价则是结果绑定在该 harness 的任务设计与工具集上。
与更早的厂商综合指数(如 Artificial Analysis 智能体指数按四类加权聚合十个评测)相比,Hermes Index 的差异点在于成本维度的显性化与 harness 的单一归属:前者广度更大,后者口径更纯粹但代表性受限于单一框架。
创刊号快照与解读边界
创刊号评测 14 个前沿模型。按 2026 年 10 月上旬榜单快照:Claude Opus 5.5 以 63.31 分居首,单任务均价 4.99 美元;GPT-6 Astra 以 56.25 分居次,均价 11.61 美元,约为冠军的两倍多;Claude Sonnet 5.5 以 53.14 分、2.82 美元排在第三;DeepSeek V4.1 Flash 36.91 分、0.259 美元;Ling 3.0 Flash 21.56 分、0.054 美元,是榜上成本量级最低的梯队。
这组数据的行业含义值得注意:分数榜的头部由 Claude 系与 GPT 系分占,而成本榜的头部完全是另一批开源与低价模型——两个维度几乎没有重叠。对企业用户而言,这意味着「选分数高的」与「选成本低的」是真实的策略分叉,而不是同一答案的两种说法。
解读边界必须同步交代:其一,快照数字仅代表发布时点,模型迭代速度快,引用时应注明日期;其二,所有分数在 Nous 自家 harness 内测得,模型在其他 harness 或真实部署中的表现可能不同,榜单官方也提示结果应作为一种观察视角;其三,Nous 在发布次日即宣布 9,000 万美元融资(累计约 1.6 亿美元、估值 15 亿美元,投资方含 Nvidia 与微软 M12),由商业化同一框架的公司为全行业排名,存在天然的利益张力,建议与多个独立榜单交叉验证。
🎯 应用场景
✅ 最佳实践
- 引用榜单时注明快照日期与 harness 归属,避免把某一时点的排名当作长期结论
- 结合至少一个独立榜单交叉验证,警惕单一厂商 harness 与商业利益的叠加偏差
- 用单任务成本而非总分作为大规模部署的初步筛选指标,再对入围模型做自有任务实测
- 关注 SkillsBench 等新增套件的权重变化,套件构成调整会使跨期分数不可直接比较
- 对开源低价模型建立单独的评估线,其成本优势在容错率高的任务上可能比头部模型更具综合性价比
🔮 未来展望
评测基准正随智能体商业模式分化:能力榜、成本榜、可靠性榜的分离意味着「一个数字定优劣」的时代在退场。Hermes Index 若能持续更新并扩大模型覆盖,其双维度数据有望成为按任务计费时代的常用参照;其长期公信力则取决于 harness 的开放程度与排名机构的独立性治理。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。