背景:AI 支出飙升下的新思路
6 月 27 日,Coinbase 首席执行官 Brian Armstrong 在社交平台发文,分享了公司在 AI 成本控制方面的突破性实践。随着 token 使用量指数级增长,AI 支出压力本应同步攀升,但 Coinbase 并未采用传统的额度限制或支出提醒手段,而是从基础设施层面寻找更高效的解决方案。Armstrong 指出,关键不在于设置使用摩擦,而在于构建更好的默认模型、路由和缓存机制。
三大核心策略:默认模型、智能路由与缓存优化
首先,Coinbase 通过 LLM 网关将默认模型切换至开放权重模型,如 GLM 5.2、Kimi 2.7 等,同时仍鼓励工程师根据具体任务灵活选择模型。数据显示,91% 的员工从未触及使用上限,因此公司没有降低额度或增加提醒,而是直接转向更低成本的默认选项,大幅降低了基准推理成本。
其次,在模型路由方面,Coinbase 在自定义流程中预处理提示词,结合缓存命中率和模型定价,将任务自动路由至最合适的模型。例如,规划阶段可能需要前沿模型(如 GPT-4),但执行阶段使用前沿模型往往过度。Armstrong 认为,未来不应由人类手动选择模型,AI 可以自动完成该任务,实现更精细的资源分配。
最后,缓存机制被 Armstrong 称为“推高成本最容易的方式”。Coinbase 所有请求都具备缓存感知能力,尽可能复用热缓存。以 LibreChat 为例,在正确实现缓存后,命中率从 5% 飙升至 60%,显著减少了重复计算带来的开销。此外,公司要求工程师保持上下文精简:切换任务时开启新会话,缩小文件上下文范围,断开未使用的工具等。
成果与展望:支出减半,增长不减
通过上述实践,Coinbase 已成功将 AI 支出削减近一半,同时 token 使用量仍在持续增长。Armstrong 强调,目标不是压制 AI 使用量,而是构建能够支撑指数级增长的基础设施。这一案例为加密行业及科技公司提供了可复用的成本优化范式:在 AI 应用爆发期,通过架构层的智能化管理,实现“用更少成本支撑更多用量”的良性循环。

