Claude Haiku 5.5评测得分43分,但最高档成本显著高于Luna

Claude Haiku 5.5评测得分43分,但最高档成本显著高于Luna

N
News Editor
2026-10-08 03:13:08
第三方评测机构 Artificial Analysis 公布 Claude Haiku 5.5 测试结果,其综合智能指数达到 43 分,较上一代提升 26 分,高于 GPT-6 Luna 的 38 分和 GLM-5.3 Flash 的 42 分,接近 Kimi K3 的 44 分。不过在最高推理强度下,Haiku 5.5 平均每项任务输出约 16.2 万 tokens,约为 Luna 的 3.2 倍,预估单任务成本也升至 0.21 美元。评测还显示,该模型在 AutomationBench-AA 自动化任务中仅得 35%,低于 Luna 的 53%。

第三方评测机构 Artificial Analysis 公布了 Claude Haiku 5.5 的测试结果。该模型在综合智能指数中获得 43 分,较上一代的 17 分提高 26 分。

从横向对比看,Haiku 5.5 超过 GPT-6 Luna 的 38 分和 GLM-5.3 Flash 的 42 分,接近 Kimi K3 的 44 分。Artificial Analysis 表示,这一指数综合了编程、专业工作、科学推理等 10 项测试。

高分伴随更高 token 消耗

评测显示,在最高推理强度下,Haiku 5.5 平均每项评测任务输出约 16.2 万 tokens,是 GPT-6 Luna 的 3.2 倍。两者基础 API 单价相同,但 Haiku 5.5 的预估单任务成本约为 0.21 美元,Luna 为 0.07 美元。

从次高档调至最高档后,Haiku 5.5 的综合得分只增加 2 分,输出量却增加约 80%。

降低推理强度后差距缩小

在 high 档位,Haiku 5.5 获得 38 分,平均每项任务输出约 5.5 万 tokens,与最高档 GPT-6 Luna 的 38 分和 5 万 tokens 接近。评测指出,开发者可以通过调整推理强度,减少不必要的 token 消耗。

自动化任务表现落后于 Luna

Haiku 5.5 并非在所有项目上都领先。在 AutomationBench-AA 自动化任务评测中,该模型得分为 35%,低于 Luna 的 53%。不过,测试期间模型存在过度拒绝执行任务的问题。

Anthropic 正在修复这一问题,Artificial Analysis 计划重新测试。另据目前公布的信息,Haiku 5.5 的任务成本尚未计入长上下文加价,实际费用可能更高。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。