Anthropic 发布了 Claude Haiku 5.5。按官方给出的定价,这一代模型的单价只有上一代 Haiku 4.5 的 1/10、Sonnet 5.5 的 1/20,与 OpenAI 的 GPT-6 Luna 处在同一价格水平。
从官方跑分表来看,Luna 参与提交成绩的 6 个项目里,Haiku 5.5 全部领先,其中多项结果也逼近 Sonnet 5.5。
价格与成本变化
Haiku 5.5 的价格分两档计算。在提示长度 10 万 Token 以内时,每百万 Token 输入价格为 0.10 美元,输出价格为 0.50 美元;超过 10 万 Token 后,输入价格升至 0.50 美元,输出价格升至 2.50 美元。
缓存读取价格为每百万 Token 0.01 美元,批处理价格在此基础上再打五折。
Anthropic 的测算显示,在处理相同任务时,Haiku 5.5 平均较 Haiku 4.5 节省约 75% 成本,在相同预算下大约可支持 4 倍调用量。
文中提到,之所以整体节省幅度没有达到九成,是因为超过 10 万 Token 的请求仅便宜一半;同时,Anthropic 表示,上一代 Haiku 约九成请求都落在 10 万 Token 以内,且新分词器会让同一段文本多出约三成 Token。
与 GPT-6 Luna 对比,在 10 万 Token 以内,两者的输入、输出和缓存价格完全相同。进入长上下文场景后,Luna 更便宜:其价格要到约 27 万 Token 左右才会上调,上调后输入价格为 0.20 美元、输出价格为 0.75 美元。
Sonnet 5.5 的缓存读取价格也从当天起下调一半,从每百万 Token 0.20 美元降至 0.10 美元。按官方测算,多数 Agent 任务的成本可下降约两成。
订阅权益方面,Max 和 Team 方案自本周起开始按月附送 API 额度。其中,Max 5x 每月赠送 100 美元,Max 20x 每月赠送 200 美元,Team 最多赠送 500 美元,且全队共用,可在 Claude Platform 上用于任意模型。
跑分大幅提升,但复杂编程仍落后 Sonnet
与上一代相比,Haiku 5.5 在多项基准测试中的提升幅度很大。
电脑操作测试 OSWorld 从上一代的 15.7% 提升到 72.4%,与 Sonnet 5.5 的差距缩小到 11.5 个百分点。与同价位的 Luna 相比,后者在 OSWorld 上为 48.9%,Haiku 5.5 领先 23.5 个百分点。文中还提到,若把成本算进去,Haiku 5.5 在 Medium 档位下就已超过 Luna 满档成绩,且费用更低。
终端编程测试 Terminal-Bench 4.0 中,Haiku 4.5 上一代为 0 分,这次提升至 39.2%。这一成绩超过 Luna 的 16.4%,但与 Sonnet 5.5 的 70.6% 仍有明显差距。
知识工作测试 GDPval-AA 中,Haiku 5.5 取得 1620 分,是上一代的两倍多,高于 Luna 的 1437 分,但仍低于 Sonnet 5.5 的 1840 分。默认 Medium 档位下,该模型得分为 1277 分。
在人类最后的考试 HLE 无工具环境中,Haiku 5.5 从上一代的 10.2% 提升到 45.9%。在调用搜索和代码工具后,HLE 成绩为 57.4%,Sonnet 5.5 为 64.5%。
长线项目测试 AA-Briefcase 中,Haiku 5.5 从上一代的 614 分提升到 1578 分,Luna 为 1336 分。
读图相关的 Chartography 测试中,Haiku 5.5 从上一代的 6.4% 提升到 46.4%,Luna 为 29.1%,Sonnet 5.5 为 61.6%。
在 FrontierCode 上,Haiku 5.5 得分为 46.4%,高于 Luna 的 42.4%,与 Sonnet 5.5 最好成绩 52.1% 相差接近 6 个百分点。
Anthropic 也明确表示,复杂的 Agent 编程任务仍更适合交给 Sonnet 5.5 和 Opus 5.5。
官方定位:高频、低成本、低延迟任务
Anthropic 将 Haiku 5.5 定位为适合大批量、追求速度和成本效率的任务,包括写摘要、压缩上下文、查询数据库和分类处理。
文中称,它也是目前速度最快的 Claude 模型,仅慢于开启快速模式的 Opus,适合实时客服和浏览器操作场景。
官方还列出了一批 AI 应用公司的内测反馈。Asana 的测试显示,其任务完成延迟较现用模型下降三成多;Box 的测试结果则显示,该模型的延迟大约只有 Haiku 4.5 的一半。
另一个主要用法,是让 Haiku 5.5 作为 Opus 或 Sonnet 的子 Agent 使用,由大模型负责拆解任务和决策,Haiku 分头执行。
Cognition 的 Devin Fusion 采用 Opus 5.5 作为主模型、Haiku 5.5 作为辅助模型后,FrontierCode 成绩稳定在 66.2 分,同时降低了成本和延迟。
金融 AI 公司 Rogo 则将其用于生成 PPT 场景中的财报数据提取,由 Haiku 5.5 从 10-K 财报中提取分部营收数据。
Claude 开发者账号给出的演示任务,是使用一批家用杂物设计一个装鸡蛋的架子,要求从 32 米高度跌落后鸡蛋不碎。由 Opus 5.5 单独完成时,耗时 3 分 37 秒,尝试 25 种方案,成本 0.47 美元;加入 10 个 Haiku 5.5 子 Agent 后,耗时缩短到 58 秒,尝试方案增加到 86 种,成本降至 0.14 美元。
上线范围与迁移调整
Haiku 5.5 已上线 Claude 客户端、Claude Code,以及 AWS、谷歌云、微软 Azure、Cursor、OpenRouter 等平台。模型 ID 为 claude-haiku-5-5,上下文窗口为 100 万 Token,单次最多输出 12.8 万 Token。
这是首个支持调节思考档位的 Haiku 模型,从 Low 到 Max 共 5 档,API 默认档位为 Medium。
Python 和 TypeScript SDK 也新增了电脑操作和浏览器操作能力,目前处于 Beta 阶段。
对从 Haiku 4.5 迁移的开发者来说,同样的文本在新模型下 Token 数会多出约三成,因此 max_tokens 设置和成本预估都需要重新计算。
接口层面,budget_tokens 已改为自适应思考与 Effort 档位;temperature、top_p、top_k 需要删除;预填回复不再可用;格式要求改为结构化输出。
电脑操作功能需切换到新工具集 computer_toolset_20260801,Priority Tier 暂不支持。
文中提到,开发者也可以在 Claude Code 中运行命令,让系统自行完成迁移。对于非开发者用户,则可以直接在客户端中与 Haiku 5.5 交互。

