返回缓存命中率

缓存命中率

GPT-6 Astra
2026-09-05 11:41:18

GPT-6 Astra新增无损换挡功能,长对话可灵活调整推理强度

OpenAI为GPT-6 Astra新增configuration_update,允许在长对话中随时调整reasoning effort而不丢失缓存。此前切换档位会导致缓存命中率从98.5%骤降至65%,重建后恢复至97%以上。该更新使难题用High或xhigh、简单任务降回Low,长上下文缓存持续复用,大幅提升长时间运行Agent的效率。

50
GPT-6 Astra新增无损换挡功能,长对话可灵活调整推理强度
高盛
2026-07-11 07:48:08

高盛拆解中国 AI 大模型格局:智谱、DeepSeek 与字节跳动居前

高盛在一份 50 页报告中评估了中国 AI 大模型的成本效率、开源策略、变现路径和长期竞争格局。报告认为,中国开源或开放权重大模型正以更低成本逼近全球顶尖专有模型;基础文本模型中,智谱与 DeepSeek 定位最强,多模态领域则由字节跳动领跑。高盛还预计,中国 AI 模型 API 和订阅收入将从 2026 年的 350 亿元增长至 2030 年的 8790 亿元。

1070
高盛拆解中国 AI 大模型格局:智谱、DeepSeek 与字节跳动居前
Coinbase
2026-07-03 16:05:29

Coinbase 采用中国 AI 模型压缩成本,AI 定价战延伸至加密行业

Coinbase 已开始采用中国 AI 模型 GLM 5.2 和 Kimi 2.7,以降低 AI 推理相关支出。报道显示,其通过自动路由、提升缓存命中率和优化上下文工程,将整体 AI 成本压缩约一半。除 Coinbase 外,Lindy 和 Snowflake 等公司也在转向更便宜的模型方案,反映出企业采购逻辑正从单纯追求头部模型性能,转向更重视性价比与成本控制。这一趋势意味着 AI 行业的定价体系正在重塑,OpenAI 与 Anthropic 等美国头部厂商面临更直接的价格竞争。

430
Coinbase 采用中国 AI 模型压缩成本,AI 定价战延伸至加密行业
Coinbase
2026-07-03 16:05:29

Coinbase 采用中国 AI 模型降本,AI 推理定价战升温

美国加密交易所 Coinbase 正在采用中国 AI 模型 GLM 5.2 和 Kimi 2.7,以降低 AI 相关支出。报道显示,Coinbase 通过自动路由、提升缓存命中率和上下文工程等方式,将模型使用成本压缩至原来的一半。除 Coinbase 外,Lindy 和 Snowflake 等公司也在转向更便宜的模型方案。这一变化表明,AI 行业的定价逻辑正在重塑,OpenAI 与 Anthropic 等头部厂商面临更直接的价格竞争压力。

400
Coinbase 采用中国 AI 模型降本,AI 推理定价战升温
Coinbase
2026-06-27 19:36:35

Coinbase 削减近半 AI 支出:默认开放权重模型、智能路由与缓存策略解析

Coinbase 首席执行官 Brian Armstrong 发文披露,公司通过多项基础设施优化将 AI 支出削减近一半,同时 token 使用量仍在增长。核心举措包括:默认采用 GLM 5.2、Kimi 2.7 等开放权重模型,替代高成本前沿模型;引入 LLM 网关实现模型智能路由,根据任务需求匹配最合适模型;实施缓存感知架构,将 LibreChat 缓存命中率从 5% 提升至 60%。此外,公司要求工程师保持上下文精简,以降低推理成本。Armstrong 强调,目标不是限制 AI 使用,而是构建可支撑指数级增长的基础设施,未来模型选择应由 AI 自动完成。

260
Coinbase 削减近半 AI 支出:默认开放权重模型、智能路由与缓存策略解析