第三方评测机构 Artificial Analysis 公布了 Claude Haiku 5.5 的测试结果。该模型在综合智能指数中获得 43 分,较上一代的 17 分提高 26 分。
从横向对比看,Haiku 5.5 超过 GPT-6 Luna 的 38 分和 GLM-5.3 Flash 的 42 分,接近 Kimi K3 的 44 分。Artificial Analysis 表示,这一指数综合了编程、专业工作、科学推理等 10 项测试。
高分伴随更高 token 消耗
评测显示,在最高推理强度下,Haiku 5.5 平均每项评测任务输出约 16.2 万 tokens,是 GPT-6 Luna 的 3.2 倍。两者基础 API 单价相同,但 Haiku 5.5 的预估单任务成本约为 0.21 美元,Luna 为 0.07 美元。
从次高档调至最高档后,Haiku 5.5 的综合得分只增加 2 分,输出量却增加约 80%。
降低推理强度后差距缩小
在 high 档位,Haiku 5.5 获得 38 分,平均每项任务输出约 5.5 万 tokens,与最高档 GPT-6 Luna 的 38 分和 5 万 tokens 接近。评测指出,开发者可以通过调整推理强度,减少不必要的 token 消耗。
自动化任务表现落后于 Luna
Haiku 5.5 并非在所有项目上都领先。在 AutomationBench-AA 自动化任务评测中,该模型得分为 35%,低于 Luna 的 53%。不过,测试期间模型存在过度拒绝执行任务的问题。
Anthropic 正在修复这一问题,Artificial Analysis 计划重新测试。另据目前公布的信息,Haiku 5.5 的任务成本尚未计入长上下文加价,实际费用可能更高。

