Cloudflare接入Kimi K2.5:安全审计Agent日处理70亿token,成本骤降77%

Cloudflare接入Kimi K2.5:安全审计Agent日处理70亿token,成本骤降77%

N
News Editor 01
2026-07-24 07:50:15
Cloudflare Workers AI平台接入月之暗面Kimi K2.5模型,用于内部安全审计Agent,每日处理超70亿token,成本较中档商业模型降低77%,并推出三项平台级优化。

Cloudflare 正式在 Workers AI 平台接入月之暗面(Moonshot AI)的 Kimi K2.5 模型,并将其设为 Agents SDK starter 的默认模型。据官方博客披露,这套模型已在内部安全审计场景中跑出惊人数据——每天处理超过 70 亿 token,成本较中档商业模型直降 77%,一年省下近 185 万美元。

日处理70亿token的安全审计Agent

Cloudflare 工程师在 OpenCode 环境中将 Kimi K2.5 作为编程 Agent 主力,并部署了一个名为 Bonk 的公开代码审查 Agent,接入自动化管线。但真正亮眼的成绩来自内部安全审计场景:这个 Agent 每天处理超过 70 亿 token。若用标准等级商业模型跑相同工作量,一年成本约 240 万美元,换成 Kimi K2.5 后直接砍掉 77%,省下 185 万美元。这个数字直接来自官方博客,并非广告话术。

Kimi K2.5 是目前开源阵营中少有的“前沿规格”模型,支持 256K 上下文窗口、多轮工具调用、视觉输入与结构化输出,长文推理能力相当实用。

三项平台级改进:针对Agent长对话场景

光换模型不够,Cloudflare 同步推出三项针对 Agent 长对话场景的优化:

  • 字首快取折扣(Prefix Caching):多轮对话中已处理过的输入 token 不再重复计费,快取命中的 token 享受折扣价,长任务下省下的成本可观。
  • Session Affinity Header:新增 x-session-affinity 请求头标,将同一会话路由到同一模型,提升快取命中率。OpenCode 与 Agents SDK starter 已内置支持。
  • 非同步批量推理 API:超出同步速率限制的请求可异步排队执行,内部测试通常在 5 分钟内完成。适合代码扫描、研究类无需实时响应的 Agent 任务。

底层推理引擎:Infire定制核心

Cloudflare 未使用现成推理框架,而是用自研 Infire 引擎做定制化核心,采用数据并行、张量并行与专家并行化,搭配分离式字首处理架构。目前 Kimi K2.5 是 Workers AI 上线大模型推理的第一个案例,也展示了 Cloudflare 在 AI 基础设施上的野心——结合网络平台优势,且足够便宜。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1900

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。