OpenRouter 的统计显示,AI 已经开始替人类大规模调用 AI。

这家模型网关给出的一组数据里,2026 年 2 月 6 日是一个明显节点:当天,人类在 OpenRouter 上消耗的 token 第一次被智能体追平。到 8 月 10 日,双方差距已经拉开到 5 倍以上。
据 OpenRouter 统计,截至 8 月 10 日,Agent 类 token 用量从约 0.51 万亿升到 7.3 万亿,增长 14 倍;人类用量也升至 1.4 万亿,但只增长了 2.8 倍。按这组口径计算,智能体当前的 token 用量已经是人类的约 5.2 倍。
文中提到,这样的变化只发生在半年内。Peter 形容,像是隔了 10 年,但 2 月 6 日其实只是半年前。
OpenRouter 如何区分人类和智能体流量
文章先解释了这组数据的来源和计算方式。
OpenRouter 是全球最大的模型网关之一,一端连接约 70 家模型供应商,另一端连接开发者,每周处理 28 万亿 token。按其联合创始人兼 COO Chris Clark 的估算,这大约相当于全球推理量的 1%,其中一半来自美国。
在这 1% 的 token 里,OpenRouter 不按身份区分用户,而是按使用方式识别流量。它通过 API key 追踪行为,再根据 7 项信号加权评分,将流量划分为 Agentic、Mixed 和 Human 三档。
这些信号包括:工具调用是否频繁、两次响应之间间隔几秒、一轮对话往返多少次等。文章给出的解释是,人类使用 AI 时通常是问一句停一会,中间要阅读、思考和输入;智能体则会连续运行,反复调用工具,循环执行多个回合,这种节奏与人类使用方式不同。

因此,这是一套估算模型,不是逐个核验的身份标签。但文章认为,方向性的判断不会偏离太多。
文中还强调,token 统计的不是有多少人在用 AI,而是 AI 在多深程度上替人完成工作。一个人类目标,现在可能触发几十轮模型调用和工具调用,消耗结构已经和早期的一问一答不同。
同一个任务,智能体会触发更多轮次
真正拉开人类和 Agent 差距的,是两边完全不同的使用方式。
文章描述的人类请求模式比较简单:打开对话框,输入提示词,等待回答,复制内容后关闭。整轮交互不到 10 句话,消耗通常只是几千个 token。
智能体则是另一种形态。用户只给出一个目标,系统会继续向下执行,读取文件、调用工具、生成结果,再继续读取、修改,直到任务结束。前期塞进去的目标、规范和上下文,会在后续不断被增量读写。
在这种模式下,一个人上午还在对话框里手动复制粘贴,下午如果把任务交给智能体持续运行,token 用量很快就会跳到另一个数量级。Peter 的说法是,真正带来量级变化的,是人们开始让智能体长时间自主运行。
缓存 token 占比高,成本仍在上升
14 倍的增长很容易让人先想到成本。

Peter 补充的一个关键点是,智能体请求天然是多轮的,平均一次智能体请求中,近 70% 的 token 来自缓存提示,而缓存通常按远低于正常输入的价格计费。
原因在于,Agent 围绕同一个目标反复读写。第一次需要把大量上下文灌入模型,例如代码规范、操作手册、工具清单,这一步按全价计算;后续每一轮只做增量更新,命中缓存的部分只按正常输入价的一小部分收费。
换句话说,那条陡峭上升的 token 曲线里,近七成来自被反复复用的同一段上下文。文章还提到,a16z 按总量口径写作 85% 以上,而 Peter 原帖按单次请求平均值给出的数字是近 70%。
单价虽然下降,但总用量飙升得更快,预算仍然会被迅速消耗。
文中举了几个例子。Uber CTO Praveen Neppalli Naga 今年早些时候透露,公司工程师只用了 4 个月就耗尽了全年 Claude Code 预算。按媒体转述,他本人一场 2 小时的演示就花了 1200 美元。
EY 也给出一组测算:同样一次客服交互,2023 年成本约 0.04 美元,到 2026 年升至约 1.20 美元,增长 30 倍。文章指出,这不是模型本身变贵,而是任务执行方式变了。过去是客户问一句、系统答一句;现在客户还是那一句提问,但背后流程可能包括查工单、调库存、翻记录,并经过十几个回合后才生成一条回复。
高盛则估算,智能体 AI 可能把 2030 年的 token 消耗推高 24 倍。

Peter 说,任何一项成本如果半年涨 14 倍,人们都会开始细抠。这也是开放权重模型和低价 token 服务突然受到关注的原因。
文章还提到,缓存 token 虽然便宜,但会占用内存。智能体如果持续运行几个小时,之所以不必从头再来,依赖的正是内存持续托住整段上下文。文中据此提到,高带宽内存近期紧俏,也可以从这里找到一部分原因。
差距不在模型,而在是否接入真实工作流
文中的判断是,决定 token 消耗规模的分水岭,不是使用哪个模型,而是模型是否被接入真实工作流。
同一个模型,如果只被当作搜索框使用,一天可能只消耗几千 token;如果连接上企业自己的文件、工具和可持续运行的流程,一天消耗几千万 token 也不罕见。
OpenAI 提供的一组企业数据被用作参照:使用最深的 10% 公司中,每名活跃用户输出的 token,是典型公司的 8.3 倍;而在 1 月,这个差距还只有 2.6 倍。半年时间,差距扩大到原来的 3 倍以上。
同一组统计还显示,头部公司的活跃用户中,每周有 21% 在使用插件,典型公司只有 9%;技能采用率分别是 19% 和 3%。OpenAI 自身内部,这个数字是 95%。
文章的解释是,把高频任务打包成可复用技能后,智能体不必每次都从头摸索,少搜几次、少返工几次,节省下来的就是成本。

token 暴涨后,验收仍然离不开人
文章最后讨论的是另一本账:谁来验收这些由智能体完成的工作。
智能体流量快速增长,不等于 AI 已经完全自主。大量任务仍然由人发起,中间也经常设置人工审批环节。
Peter 原帖评论区一位服务业客户开发者提到,他服务的那些老板从没想过完全撒手,采购、发送、签字,每一步都要回到人工处理。
但问题在于,流程绕回人工,不代表一定有人真正检查。另一位从业者称,他们的智能体删除了广告账户中的 18 个视频,直到整整一天后才被发现。文中认为,这不一定是模型犯下多严重的错误,更直接的问题是那一步根本没人查看。
文章写道,token 开销可以在半年里增长 14 倍,但负责验收的人手不可能同步扩张。这可能是这一轮增长中最容易被忽视、也最昂贵的一项成本。
分析、调研、初稿和方案这类重复执行动作,往后都会变得更充足;真正稀缺的,将是验证、判断,以及决定什么事情值得去做。AI 已经成为 token 的主要消费方,但到目前为止,它还不能替人签字。
文中最后给出的判断是,未来的问题不再只是是否使用 AI,而是 AI 替人做完的那些工作,最终由谁验收,谁来决定下一步。

