a16z:Agent Token 消耗已接近人类用户 5 倍
创投机构 Andreessen Horowitz(a16z)最新一期《Charts of the Week》指出,AI Agent 不仅增长很快,Token 消耗量也已接近一般人类使用者的 5 倍;自今年 2 月以来,Agent 使用量更成长约 14 倍。
a16z 认为,这种变化背后还可能带来一个硬件层面的受益方向:高频宽内存(HBM)。原因在于,Agent 的工作方式大量依赖 Cached Token(快取 Token),与一般使用者「一问一答」的聊天模式不同,可能进一步推升 AI 基础设施对内存的需求。
企业 AI 使用开始分化
a16z 引述 OpenAI 数据指出,企业 AI 使用量虽然普遍增加,但成长并不平均。自 2025 年 4 月以来,一般企业的 Output Token 大致增加一倍,但使用量排名前 10% 的企业已成长超过 17 倍。目前,前 10% 企业与典型企业之间的 Token 输出量差距约为 8 倍。
在资讯科技产业,这个差距甚至接近 12 倍,其中前 10% 企业的 Token 输出量已是约一年前的 32.5 倍。a16z 认为,这也显示企业 AI 市场可能正从单纯比较「有没有使用 AI」,转向比较「AI 已经深入工作流程到什么程度」。
重度使用企业不再只把 AI 当聊天机器人
a16z 指出,前 10% 企业的 Plug-in 采用程度约为典型企业的 2 倍,而 Skills 采用程度则约为 6 倍。也就是说,重度使用企业已经把 AI 用在更复杂的流程里,而不只是对话。
值得注意的是,近期进展最快的产业甚至不是科技业。若以 Codex 采用率衡量进阶 AI 工具使用程度,法律产业自 2026 年 2 月以来的采用率暴增 108 倍。不过 a16z 也提醒,目前仍难以区分其中有多少来自 Codex 本身扩大推出。
Cached Token 推动 Agent 继续放大内存需求
a16z 引述 OpenRouter 与 Peter Walker 整理的数据指出,目前真正部署完整 Agent 的 AI 使用者仍只占少数,但 Agent 已经消耗极为庞大的 Token。当前 Agent 使用的 Token 接近人类使用者的 5 倍,而 Agent 使用量自今年 2 月以来更已增加约 14 倍。
这一点与 Agent 的运作模式有关。一般人使用 ChatGPT、Claude 等 AI 工具时,通常采取「Prompt → Response」模式;但 Agent 接到任务后,需要持续读取资讯、呼叫工具、写入结果,再根据前一步输出进行下一轮操作。换句话说,一个人可能只送出一次指令,但 Agent 在完成任务之前,可能自行运作许多轮。
OpenRouter 数据显示,超过 85% 的 Agent Token 消耗来自 Cached Prompt,而近期 Agent Token 使用量增加,也几乎都是由 Cached Token 推动。原因在于,Agent 开始执行任务时,需要先载入大量背景资讯,例如系统规则、程式码规范、公司政策以及任务 Context;完成初始 Prefill 后,Agent 不必每一次推理都重新载入全部内容,而是持续利用已快取的 Context,再逐步读写新的资讯。
Cached Token 的成本通常比重新执行 Prefill 更低,因此有利于降低 Agent 长时间运作的推理成本;但另一面是,这种模式对内存资源的需求也更高。a16z 因此将 Agent 的崛起与目前 HBM 的强劲需求连结起来:当大量 Agent 同时持续运作,而且不断保存与重复使用 Context,AI 推理基础设施除了需要 GPU 算力,也需要大量高频宽内存支撑。

