AI 推理成本每年下降约 60%,企业账单却没有跟着回落。Red Hat 投资组合策略总监 Brian Gracely 在 VentureBeat AI 活动上把这个矛盾摆上台面:测试阶段已经过了,企业现在面对的是更直接的问题——AI 到底带来了多少回报,预算又该怎么���住。
他把这一阶段称为 AI 的“Day 2 时刻”。把模型放进沙盒里跑通,只是开始;真正麻烦的是把系统放进生产环境后,还要保证稳定、可治理,并且不把预算迅速烧穿。Gracely认为,成本控制、治理框架和长期可持续性,比最初搭建系统更难处理。
算力更便宜,使用量却扩得更快
这一现象对应的正是杰文斯悖论。19 世纪经济学家 William Stanley Jevons 在研究煤炭使用时发现,效率提升不一定带来消耗下降,反而可能刺激更大规模的使用。放到 AI 领域,同样的逻辑正在重演:单次推理价格下降,调用量却可能成倍增长,结果是总支出继续抬升。
Gracely举例称,一些企业已经购买了 5 万个 Copilot 授权,但并不清楚员工究竟从中获得了什么,只知道自己正在为昂贵的 GPU 算力持续付费。问题不在于能不能部署 AI,而在于支出是否能被解释、被控制。
从被动消耗 token,转向主动管理工作负载
在 Gracely 看来,企业不能只做 token 的被动消费者,还要开始考虑如何成为 token 的主动管理者,���至在部分场景中成为“生产者”。这背后对应的是更细的资源分配思路:哪些任务必须交给最强、最新的模型,哪些任务其实可以由开源模型或小型模型完成。
比如内部知识库查询、文件摘要、常见客服问答,并不一定都要调用顶级模型。把高成本算力留给真正需要复杂推理的任务,账单结构才有优化空间。按他的说法,这可能意味着企业自营 GPU,也可能是租用 GPU,核心是对关键工作负载保留更多掌控权。
开源模型增加了企业的选择空间
市场条件也在变化。两年前,企业方案大多集中在少数云服务商和 Copilot 这类打包产品上;现在,随着 DeepSeek 等开源模型崛起,可选路径明显变多,企业在技术替代和价格谈判上都拥有了更多余地。
Gracely 在演讲最后提醒,AI 实际上只发展了 3 年,仍处在早期阶段,而且变化速度很快。对企业来说,眼下更现实的动作不是盲目追求更大规模部署,而是逐项盘点:哪些 AI 授权和算力开支带来了可量化价值,哪些只是维持“在用 AI”的表面动作。

