OpenRouter:AI 智能体 token 用量半年增至人类 5.2 倍

OpenRouter:AI 智能体 token 用量半年增至人类 5.2 倍

N
News Editor
2026-08-25 07:17:08
OpenRouter 数据显示,截至 8 月 10 日,Agent 类 token 用量已从约 0.51 万亿升至 7.3 万亿,同期人类用量升至 1.4 万亿,智能体达到人类的 5.2 倍。平台依据 API key 的 7 项行为信号区分 Agentic、Mixed 和 Human 流量。文中还提到,智能体请求中近 70% 的 token 来自缓存提示,单价下降未能抵消总用量飙升带来的成本压力。

OpenRouter 的统计显示,AI 已经开始替人类大规模调用 AI。

OpenRouter:AI 智能体 token 用量半年增至人类 5.2 倍 2

这家模型网关给出的一组数据里,2026 年 2 月 6 日是一个明显节点:当天,人类在 OpenRouter 上消耗的 token 第一次被智能体追平。到 8 月 10 日,双方差距已经拉开到 5 倍以上。

据 OpenRouter 统计,截至 8 月 10 日,Agent 类 token 用量从约 0.51 万亿升到 7.3 万亿,增长 14 倍;人类用量也升至 1.4 万亿,但只增长了 2.8 倍。按这组口径计算,智能体当前的 token 用量已经是人类的约 5.2 倍。

文中提到,这样的变化只发生在半年内。Peter 形容,像是隔了 10 年,但 2 月 6 日其实只是半年前。

OpenRouter 如何区分人类和智能体流量

文章先解释了这组数据的来源和计算方式。

OpenRouter 是全球最大的模型网关之一,一端连接约 70 家模型供应商,另一端连接开发者,每周处理 28 万亿 token。按其联合创始人兼 COO Chris Clark 的估算,这大约相当于全球推理量的 1%,其中一半来自美国。

在这 1% 的 token 里,OpenRouter 不按身份区分用户,而是按使用方式识别流量。它通过 API key 追踪行为,再根据 7 项信号加权评分,将流量划分为 Agentic、Mixed 和 Human 三档。

这些信号包括:工具调用是否频繁、两次响应之间间隔几秒、一轮对话往返多少次等。文章给出的解释是,人类使用 AI 时通常是问一句停一会,中间要阅读、思考和输入;智能体则会连续运行,反复调用工具,循环执行多个回合,这种节奏与人类使用方式不同。

OpenRouter:AI 智能体 token 用量半年增至人类 5.2 倍 3

因此,这是一套估算模型,不是逐个核验的身份标签。但文章认为,方向性的判断不会偏离太多。

文中还强调,token 统计的不是有多少人在用 AI,而是 AI 在多深程度上替人完成工作。一个人类目标,现在可能触发几十轮模型调用和工具调用,消耗结构已经和早期的一问一答不同。

同一个任务,智能体会触发更多轮次

真正拉开人类和 Agent 差距的,是两边完全不同的使用方式。

文章描述的人类请求模式比较简单:打开对话框,输入提示词,等待回答,复制内容后关闭。整轮交互不到 10 句话,消耗通常只是几千个 token。

智能体则是另一种形态。用户只给出一个目标,系统会继续向下执行,读取文件、调用工具、生成结果,再继续读取、修改,直到任务结束。前期塞进去的目标、规范和上下文,会在后续不断被增量读写。

在这种模式下,一个人上午还在对话框里手动复制粘贴,下午如果把任务交给智能体持续运行,token 用量很快就会跳到另一个数量级。Peter 的说法是,真正带来量级变化的,是人们开始让智能体长时间自主运行。

缓存 token 占比高,成本仍在上升

14 倍的增长很容易让人先想到成本。

OpenRouter:AI 智能体 token 用量半年增至人类 5.2 倍 4

Peter 补充的一个关键点是,智能体请求天然是多轮的,平均一次智能体请求中,近 70% 的 token 来自缓存提示,而缓存通常按远低于正常输入的价格计费。

原因在于,Agent 围绕同一个目标反复读写。第一次需要把大量上下文灌入模型,例如代码规范、操作手册、工具清单,这一步按全价计算;后续每一轮只做增量更新,命中缓存的部分只按正常输入价的一小部分收费。

换句话说,那条陡峭上升的 token 曲线里,近七成来自被反复复用的同一段上下文。文章还提到,a16z 按总量口径写作 85% 以上,而 Peter 原帖按单次请求平均值给出的数字是近 70%。

单价虽然下降,但总用量飙升得更快,预算仍然会被迅速消耗。

文中举了几个例子。Uber CTO Praveen Neppalli Naga 今年早些时候透露,公司工程师只用了 4 个月就耗尽了全年 Claude Code 预算。按媒体转述,他本人一场 2 小时的演示就花了 1200 美元。

EY 也给出一组测算:同样一次客服交互,2023 年成本约 0.04 美元,到 2026 年升至约 1.20 美元,增长 30 倍。文章指出,这不是模型本身变贵,而是任务执行方式变了。过去是客户问一句、系统答一句;现在客户还是那一句提问,但背后流程可能包括查工单、调库存、翻记录,并经过十几个回合后才生成一条回复。

高盛则估算,智能体 AI 可能把 2030 年的 token 消耗推高 24 倍。

OpenRouter:AI 智能体 token 用量半年增至人类 5.2 倍 5

Peter 说,任何一项成本如果半年涨 14 倍,人们都会开始细抠。这也是开放权重模型和低价 token 服务突然受到关注的原因。

文章还提到,缓存 token 虽然便宜,但会占用内存。智能体如果持续运行几个小时,之所以不必从头再来,依赖的正是内存持续托住整段上下文。文中据此提到,高带宽内存近期紧俏,也可以从这里找到一部分原因。

差距不在模型,而在是否接入真实工作流

文中的判断是,决定 token 消耗规模的分水岭,不是使用哪个模型,而是模型是否被接入真实工作流。

同一个模型,如果只被当作搜索框使用,一天可能只消耗几千 token;如果连接上企业自己的文件、工具和可持续运行的流程,一天消耗几千万 token 也不罕见。

OpenAI 提供的一组企业数据被用作参照:使用最深的 10% 公司中,每名活跃用户输出的 token,是典型公司的 8.3 倍;而在 1 月,这个差距还只有 2.6 倍。半年时间,差距扩大到原来的 3 倍以上。

同一组统计还显示,头部公司的活跃用户中,每周有 21% 在使用插件,典型公司只有 9%;技能采用率分别是 19% 和 3%。OpenAI 自身内部,这个数字是 95%。

文章的解释是,把高频任务打包成可复用技能后,智能体不必每次都从头摸索,少搜几次、少返工几次,节省下来的就是成本。

OpenRouter:AI 智能体 token 用量半年增至人类 5.2 倍 6

token 暴涨后,验收仍然离不开人

文章最后讨论的是另一本账:谁来验收这些由智能体完成的工作。

智能体流量快速增长,不等于 AI 已经完全自主。大量任务仍然由人发起,中间也经常设置人工审批环节。

Peter 原帖评论区一位服务业客户开发者提到,他服务的那些老板从没想过完全撒手,采购、发送、签字,每一步都要回到人工处理。

但问题在于,流程绕回人工,不代表一定有人真正检查。另一位从业者称,他们的智能体删除了广告账户中的 18 个视频,直到整整一天后才被发现。文中认为,这不一定是模型犯下多严重的错误,更直接的问题是那一步根本没人查看。

文章写道,token 开销可以在半年里增长 14 倍,但负责验收的人手不可能同步扩张。这可能是这一轮增长中最容易被忽视、也最昂贵的一项成本。

分析、调研、初稿和方案这类重复执行动作,往后都会变得更充足;真正稀缺的,将是验证、判断,以及决定什么事情值得去做。AI 已经成为 token 的主要消费方,但到目前为止,它还不能替人签字。

文中最后给出的判断是,未来的问题不再只是是否使用 AI,而是 AI 替人做完的那些工作,最终由谁验收,谁来决定下一步。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
40

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。