📊 评测基准

Hermes Index(智能体模型指数)

别名:Hermes IndexHermes BenchNous 智能体指数智能体成本绩效榜
分类📊 评测基准
阅读时间⏱️ 14 分钟
更新时间📅 2026-10-12
条目编号ENC-BENCH-20-hermes-index
开源实验室 Nous Research 于 2026 年 10 月 6 日发布的智能体能力排行榜,在其自研 Hermes Agent 框架内对前沿模型按任务表现与单任务成本双维度排名。

关键要点 ✦

为什么需要表现与成本双维度

传统模型榜单只回答「谁分数高」,但智能体的商业现实是按任务付费:一家每天跑数千个智能体任务的企业,关心的不是高出两分,而是每分背后的账单。两个任务成本相差数倍的模型,可能在总分接近时代表完全不同的采购决策。

据 Crypto Briefing 对发布信息的整理,Hermes Index 的指标设计直接回应这一现实:它测量模型作为智能体在 Hermes Agent 框架内的表现,同时跟踪每个任务的实际运行成本,榜单同时给出平均分与单任务均价。这使「性价比位」成为榜单的显性信息——例如创刊号中 Claude Sonnet 5.5 以约一半的分数差距换来约一半的成本,而 GPT-6 Astra 的高分伴随翻倍以上的单价。

这一思路与本站智能体定价词条讨论的行业趋势一致:当智能体商业模式向按任务量计费迁移,评测口径也必然从「能力单维度」走向「能力与成本的双维度」。

构成:Hermes Bench 与既有套件的组合

据发布报道,Hermes Index 由四套测试套件平均而成。核心是自建的 Hermes Bench:150 个任务、覆盖 25 个类别,任务设计强调与用户意图对齐。此外纳入了 Terminal-Bench 4.0(终端操作,见本站词条)与 SkillsBench 等既有评测,形成通用任务与专项能力的组合。

所有评测统一经 Hermes Agent 运行。Hermes Agent 是 Nous Research 于 2026 年 2 月 25 日启动的评测 harness,定位为聚焦用户对齐表现的智能体运行环境。统一 harness 的好处是横向可比——同一运行环境下 14 个模型的分数与成本可直接对照;代价则是结果绑定在该 harness 的任务设计与工具集上。

与更早的厂商综合指数(如 Artificial Analysis 智能体指数按四类加权聚合十个评测)相比,Hermes Index 的差异点在于成本维度的显性化与 harness 的单一归属:前者广度更大,后者口径更纯粹但代表性受限于单一框架。

创刊号快照与解读边界

创刊号评测 14 个前沿模型。按 2026 年 10 月上旬榜单快照:Claude Opus 5.5 以 63.31 分居首,单任务均价 4.99 美元;GPT-6 Astra 以 56.25 分居次,均价 11.61 美元,约为冠军的两倍多;Claude Sonnet 5.5 以 53.14 分、2.82 美元排在第三;DeepSeek V4.1 Flash 36.91 分、0.259 美元;Ling 3.0 Flash 21.56 分、0.054 美元,是榜上成本量级最低的梯队。

这组数据的行业含义值得注意:分数榜的头部由 Claude 系与 GPT 系分占,而成本榜的头部完全是另一批开源与低价模型——两个维度几乎没有重叠。对企业用户而言,这意味着「选分数高的」与「选成本低的」是真实的策略分叉,而不是同一答案的两种说法。

解读边界必须同步交代:其一,快照数字仅代表发布时点,模型迭代速度快,引用时应注明日期;其二,所有分数在 Nous 自家 harness 内测得,模型在其他 harness 或真实部署中的表现可能不同,榜单官方也提示结果应作为一种观察视角;其三,Nous 在发布次日即宣布 9,000 万美元融资(累计约 1.6 亿美元、估值 15 亿美元,投资方含 Nvidia 与微软 M12),由商业化同一框架的公司为全行业排名,存在天然的利益张力,建议与多个独立榜单交叉验证。

🎯 应用场景

智能体模型选型
以表现与成本双维度对照候选模型,匹配自身任务的预算与质量要求。
按任务量计费的成本测算
用单任务均价估算大规模部署的月度账单区间,辅助商业模式定价。
性价比梯队分析
跟踪高分高成本与低成本低成本两个梯队的收敛趋势,判断开源模型的追赶节奏。
harness 敏感性研究
将同批模型在其他 harness 下的得分与本榜单对照,量化评测框架对结论的影响。

✅ 最佳实践

  • 引用榜单时注明快照日期与 harness 归属,避免把某一时点的排名当作长期结论
  • 结合至少一个独立榜单交叉验证,警惕单一厂商 harness 与商业利益的叠加偏差
  • 用单任务成本而非总分作为大规模部署的初步筛选指标,再对入围模型做自有任务实测
  • 关注 SkillsBench 等新增套件的权重变化,套件构成调整会使跨期分数不可直接比较
  • 对开源低价模型建立单独的评估线,其成本优势在容错率高的任务上可能比头部模型更具综合性价比

🔮 未来展望

评测基准正随智能体商业模式分化:能力榜、成本榜、可靠性榜的分离意味着「一个数字定优劣」的时代在退场。Hermes Index 若能持续更新并扩大模型覆盖,其双维度数据有望成为按任务计费时代的常用参照;其长期公信力则取决于 harness 的开放程度与排名机构的独立性治理。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

📖 相关条目

🛠️ 相关产品

🏷️ 标签Hermes IndexNous Research评测基准成本效率智能体榜单Hermes Agent