Nous Research 为 Hermes Agent 上线模型排行榜 Hermes Index,用来比较不同模型在 Hermes 里的表现。
所有模型都使用同一套 Hermes Agent 运行框架,支持调节推理强度的统一设为 high。榜单取 Hermes Bench、Terminal-Bench 4、Terminal-Bench Science 和 SkillsBench 四项测试的平均分,同时统计平均每任务成本。
Hermes Bench纳入 150 个任务
其中,Hermes Bench 是 Nous Research 新推出的测试,共有 150 个任务、25 类场景,覆盖 Skills、研究、图表与创作、记忆、工具调用和安全。Agent 会直接处理工作区和真实文件,最后根据生成的文件、任务状态和工具使用记录评分。
首版榜单共测试 14 个模型。Claude Opus 5.5 以 63.31 分排第一,GPT 6 Astra 以 56.25 分排第二,Claude Sonnet 5.5 以 53.14 分排第三。
Astra单任务成本为全榜最高
成本方面,GPT 6 Astra 平均每个任务花费 11.61 美元,是全榜最高。Claude Opus 5.5 为 4.99 美元,Claude Sonnet 5.5 为 2.82 美元,两者部分数据仍被官方标为暂定。
低价模型中,DeepSeek V4.1 Flash 得到 36.91 分,平均每任务花费 0.259 美元;GPT 6 Luna 为 33.89 分,每任务 0.141 美元。两者都进入成本与性能的 Pareto 前沿,即不存在价格更低、同时分数更高的模型。

