Hermes模型榜首版发布:Opus 5.5居首,Astra排名第二但成本最高

Hermes模型榜首版发布:Opus 5.5居首,Astra排名第二但成本最高

N
News Editor
2026-10-07 03:09:17
Nous Research 为 Hermes Agent 上线模型排行榜 Hermes Index,首版测试 14 个模型,统一在同一运行框架下比较表现。榜单按 Hermes Bench、Terminal-Bench 4、Terminal-Bench Science 和 SkillsBench 四项测试平均分排名,并统计平均每任务成本。Claude Opus 5.5 以 63.31 分位列第一,GPT 6 Astra 以 56.25 分排第二,但平均每任务成本达到 11.61 美元,为全榜最高。

Nous Research 为 Hermes Agent 上线模型排行榜 Hermes Index,用来比较不同模型在 Hermes 里的表现。

所有模型都使用同一套 Hermes Agent 运行框架,支持调节推理强度的统一设为 high。榜单取 Hermes Bench、Terminal-Bench 4、Terminal-Bench Science 和 SkillsBench 四项测试的平均分,同时统计平均每任务成本。

Hermes Bench纳入 150 个任务

其中,Hermes Bench 是 Nous Research 新推出的测试,共有 150 个任务、25 类场景,覆盖 Skills、研究、图表与创作、记忆、工具调用和安全。Agent 会直接处理工作区和真实文件,最后根据生成的文件、任务状态和工具使用记录评分。

首版榜单共测试 14 个模型。Claude Opus 5.5 以 63.31 分排第一,GPT 6 Astra 以 56.25 分排第二,Claude Sonnet 5.5 以 53.14 分排第三。

Astra单任务成本为全榜最高

成本方面,GPT 6 Astra 平均每个任务花费 11.61 美元,是全榜最高。Claude Opus 5.5 为 4.99 美元,Claude Sonnet 5.5 为 2.82 美元,两者部分数据仍被官方标为暂定。

低价模型中,DeepSeek V4.1 Flash 得到 36.91 分,平均每任务花费 0.259 美元;GPT 6 Luna 为 33.89 分,每任务 0.141 美元。两者都进入成本与性能的 Pareto 前沿,即不存在价格更低、同时分数更高的模型。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。