背景:AI支出增长与Coinbase的应对思路
6月27日,Coinbase CEO Brian Armstrong发文说明了公司在AI成本控制上的最新实践。Armstrong指出,若想在token使用量指数级增长的同时保持AI支出稳定,关键并非设置使用摩擦或支出提醒,而是采用更好的默认模型、路由机制和缓存策略。基于这一思路,Coinbase进行了一系列系统优化,最终将AI支出削减近一半,而token使用量仍保持增长态势。
三大核心策略:默认模型、路由与缓存
默认模型切换至开放权重模型
Coinbase通过自研的LLM网关,将默认模型调整为GLM 5.2、Kimi 2.7等开放权重模型。公司调查发现,91%的员工从未触及使用上限,因此没有采取降低额度或增加提醒的方式,而是直接转向更低成本的默认模型。同时,仍然鼓励工程师根据具体任务灵活选择合适的模型。
智能模型路由:规划阶段用前沿,执行阶段用轻量
在模型路由方面,Coinbase在自定义流程中预处理提示词,并根据缓存命中率和模型定价将任务路由至最合适模型。例如,规划阶段可能需要前沿模型,但执行阶段使用前沿模型可能造成资源浪费。Armstrong认为,未来不应由人类手动选择模型,AI可以自动完成该任务。
缓存优化:命中率从5%提升至60%
缓存未命中是推高成本最容易的方式。Coinbase所有请求均具备缓存感知能力,以尽可能复用热缓存。在实际实施中,LibreChat的缓存命中率从5%大幅提升至60%,显著降低了重复计算的成本。此外,Coinbase还要求工程师保持上下文精简,包括切换任务时开启新会话、缩小文件上下文范围、断开未使用的工具等。
成果与展望:削减支出但不抑制使用
通过上述实践,Coinbase已将AI总支出削减近一半,同时token使用量仍在继续增长。Armstrong强调,目标不是压制AI使用量,而是构建可支撑指数级增长的基础设施。未来,AI选择模型、路由和缓存的自动优化将成为常态,人类只需设定总体策略即可。

