Cloudflare 正式在 Workers AI 平台接入月之暗面(Moonshot AI)的 Kimi K2.5 模型,并将其设为 Agents SDK starter 的默认模型。据官方博客披露,这套模型已在内部安全审计场景中跑出惊人数据——每天处理超过 70 亿 token,成本较中档商业模型直降 77%,一年省下近 185 万美元。
日处理70亿token的安全审计Agent
Cloudflare 工程师在 OpenCode 环境中将 Kimi K2.5 作为编程 Agent 主力,并部署了一个名为 Bonk 的公开代码审查 Agent,接入自动化管线。但真正亮眼的成绩来自内部安全审计场景:这个 Agent 每天处理超过 70 亿 token。若用标准等级商业模型跑相同工作量,一年成本约 240 万美元,换成 Kimi K2.5 后直接砍掉 77%,省下 185 万美元。这个数字直接来自官方博客,并非广告话术。
Kimi K2.5 是目前开源阵营中少有的“前沿规格”模型,支持 256K 上下文窗口、多轮工具调用、视觉输入与结构化输出,长文推理能力相当实用。
三项平台级改进:针对Agent长对话场景
光换模型不够,Cloudflare 同步推出三项针对 Agent 长对话场景的优化:
- 字首快取折扣(Prefix Caching):多轮对话中已处理过的输入 token 不再重复计费,快取命中的 token 享受折扣价,长任务下省下的成本可观。
- Session Affinity Header:新增
x-session-affinity请求头标,将同一会话路由到同一模型,提升快取命中率。OpenCode 与 Agents SDK starter 已内置支持。 - 非同步批量推理 API:超出同步速率限制的请求可异步排队执行,内部测试通常在 5 分钟内完成。适合代码扫描、研究类无需实时响应的 Agent 任务。
底层推理引擎:Infire定制核心
Cloudflare 未使用现成推理框架,而是用自研 Infire 引擎做定制化核心,采用数据并行、张量并行与专家并行化,搭配分离式字首处理架构。目前 Kimi K2.5 是 Workers AI 上线大模型推理的第一个案例,也展示了 Cloudflare 在 AI 基础设施上的野心——结合网络平台优势,且足够便宜。

