腾讯研究院在新书《Token 经济》导言中提出,理解 Token,才能理解 AI 经济。文章的核心判断是,消耗一个 Token,购买的不是存储空间、计算次数或信息传输,而是模型对问题进行一次智力加工的服务。理解一句话、生成一段代码、做出一个判断,这类过去主要由人类大脑完成的活动,如今第一次拥有了可精确计量的单位和可执行的价格。

文章先从经济史中的计量单位切入。其观点是,识别产业革命的一种朴素方法,是看新的计量单位何时出现。计量单位决定了什么可以被交易、被定价、被纳入经济体系;当一种原本模糊的产出被标准化度量,围绕它的定价、交易、竞争和制度也会随之形成。
文中回顾了几次重大经济变革中的代表性单位。农业社会有蒲式耳。在标准化之前,粮食只能按麻袋估价,一袋小麦和另一袋小麦的数量取决于袋子大小和卖家是否诚信。蒲式耳出现后,不只是交易更方便,也让远期合约成为可能,让买家可以在芝加哥购买从未见过的堪萨斯小麦。铁路降低了跨区域交易成本,但真正让期货交易成立的,是标准化的蒲式耳。没有这一单位,即使铁路通了,也无法为一批没有亲眼见过的小麦定价。文章据此认为,蒲式耳让农业产出第一次变成可远程交易的标准商品。
能源时代有桶。1 标准油桶等于 42 加仑,这一源自宾夕法尼亚油田主临时选择的单位在 1866 年被标准化后,石油才成为可以跨国定价、全球流动的商品。内燃机和汽车工业创造了石油的巨大需求,而“桶”这一标准化计量,则让石油从地方性矿物转变为全球金融市场上可以对冲、做空、期货化的资产。
电气化时代有千瓦时。文章提到,1889 年英国工程师首次提出“千瓦时”概念;1948 年,国际电工委员会(IEC)正式承认“度”为千瓦时的俗称,允许非官方使用。此后,千瓦时逐渐成为全球通用的电力交易单位。电力在发电厂和千家万户之间流动,但只有在具备标准计量方式后,电网调度、电力交易市场和工业能耗管理才成为可能。按文中说法,千瓦时让电力的生产和消费第一次有了可计价的成本尺度。
信息社会有比特。文章援引香农 1948 年的论文《通信的数学理论》,称信息熵的数学框架让“比特”成为信息的度量单位,使信息从抽象概念变成可以精确测量、传输和存储的客观存在。在比特出现之前,信息量更像一种模糊直觉;有了比特之后,电话线路容量、硬盘存储空间和互联网带宽都有了可计价的度量。比特由此为信息的存储、传输和交易提供了统一基础。
Token 计量的是机器处理智力任务的产出量
文章认为,上述 4 个计量单位有一个共同点:它们计量的都是可还原为物理过程的对象。蒲式耳计量物质,桶计量容积,千瓦时计量能量,比特计量信息的编码与传输。即便比特看起来已经脱离物理世界,它归根到底衡量的仍是信号编码长度,也就是“有多少”;至于一个比特存了什么内容、内容是否有用,并不属于比特概念本身。
与此不同,Token 计量的不是物质、能量或信息,而是机器处理智力任务的产出量。文章将其概括为“智力即服务”(intelligence as a service)。过去购买智力,买的是人、工时、岗位或项目,智力绑定在具体的人身上,无法被单独计量;现在购买智力,买的是 Token、任务、工作流、结果,甚至是不知疲倦的数字员工。文章据此认为,智力第一次脱离单个具体的人脑,可以被连续调用、计量和计费,而 Token 正是这套交易结构中的计量单位。
文中同时强调,Token 计量的是智力服务的产出,但它本身并不是智力。若借用工业时代的比方,Token 之于智力服务,有点像原材料和能源之于工业生产。原材料的质量和数量、能源的质量和数量,会影响工业生产;类似地,Token 的质量和数量,也构成观察认知生产线的一套新仪表。
文章进一步把大模型与工业化生产作比较。其说法是,交通运输解决的是“把已有东西运到哪里”,而大模型解决的是“把输入加工成什么判断、方案和结果”。蒸汽机和电动机让体力劳动第一次被大规模能源化;大模型正在做类似的事,只是对象从体力劳动变成了认知劳动。对应到机器智力生产,数据、上下文、提示词、工具说明和企业知识库构成输入材料,电力、芯片和推理时间提供能源,模型架构、路由、缓存和工作流编排则构成工艺。
Token 的价值由使用场景决定
文章指出,“按量购买智力服务”与按量购买石油存在根本差异。石油、小麦、电力的价值主要由生产端决定,一蒲式耳小麦的品质在收割时已基本确定,一桶原油的品级在出井时也可测量;Token 则相反,它的价值完全由使用场景决定。
文中举例称,用同一个模型审阅一份价值百万美元的并购合同,与用它闲聊天气,消耗的 Token 数量可能相当,但创造的经济价值却可能相差悬殊。而且这种差异只能在调用完成之后才知道,事前无法标注,也无法分级。
文章还提到,Token 在不同用途之间切换的边际成本接近零。同一个模型、同一个 API,换一条指令,就能从闲聊切换到合同审查。由此形成的一个突出特点是,生产端可以被统一计量,消费端交付的却是高度非标准的智力成果,两者彻底脱钩。文章认为,传统经济学供需分析通常假设生产端特征与消费端价值是耦合的,而这一前提在 Token 时代不再成立。
一个已经运转起来的经济体
文章判断,Token 经济已经真实存在,而且增长速度超过了几乎所有此前商品在同一阶段的扩张速度。
文中写道,全球头部人工智能公司 OpenAI 在 2026 年 3 月披露,其 API 处理速率已达每分钟 150 亿 Token。该数字仅统计 API 端口,不包括 ChatGPT 消费者端产品的消耗。不到半年前的 2025 年 10 月,OpenAI 在开发者日公布的数字还是每分钟 60 亿 Token。从 60 亿到 150 亿,5 个月增长了 1.5 倍。
文章同时提到,Anthropic、谷歌、Meta 以及中国数十家模型提供商,也各自运营着规模不等的推理基础设施。在全球范围内,截至 2026 年年初,推理已占据全部 AI 算力的约 2/3,而 2023 年这一比例还是 1/3。
中国市场的增长被描述为更为惊人。根据国家数据局 2026 年 3 月在中国发展高层论坛上的披露,中国日均 Token 调用量在 2024 年年初约为 1000 亿,2025 年年底跃升至 100 万亿,2026 年 3 月已突破 140 万亿。文章称,两年时间增长超过 1000 倍。
从全球支出看,IDC(国际数据公司)在 2026 年 4 月发布的报告显示,2025 年全球 AI 基础设施支出达到 3180 亿美元,较 2024 年的 1530 亿美元翻了一倍有余。文章据此认为,Token 正在变成一种新型生产要素,而且不是未来时,而是进行时。
文章还引用了英伟达 CEO 黄仁勋在 2026 年 3 月 GTC 大会后一次访谈中的表述。黄仁勋说:「一个年薪 50 万美元的工程师,如果一年消耗不到 25 万美元的 Token,我会非常担心。」他还说:「如果顶尖工程师说『我打算只用纸和笔工作』,那么这跟芯片设计师拒绝用 EDA(电子设计自动化)工具一样荒谬。」文章指出,这里的重点不在具体金额,因为 Token 价格持续下降,数字很快会过时;更重要的是,这反映出一种正在形成的衡量标准:Token 消耗量正在成为衡量知识工作者生产力的新维度。
单价暴跌,总支出反而上升
文章认为,这些数字背后隐藏着一个反直觉的结构性事实:单价在暴跌,总支出反而在暴涨。
以 GPT-4 级别能力为基准,文中称,2023 年年初的推理定价约为每百万输出 Token 60 美元;到 2025 年,同等能力水平的市场价格已不到 1 美元,降幅接近两个数量级。与此同时,全球 AI 基础设施总支出翻了一倍有余,头部厂商收入也在同步上升。
文章将这一现象归入“杰文斯悖论”。其举例称,19 世纪蒸汽机效率提高,理论上煤炭消耗应当减少,但事实是煤炭总消耗反而大幅增加。文中认为,Token 市场正在上演类似情形,而且节奏更快、幅度更大。
Token 经济为何让企业和分析框架感到棘手
文章接着讨论,真正值得关注的,不只是规模和增速,而是 Token 经济在实际运行中不断挑战既有分析框架。
文中设定了一个场景:如果一家中等规模科技公司的战略负责人,需要从零搭建企业 AI 采购体系,很快就会发现,MBA 课程中常见的供应商评估、成本分析和采购谈判方法,在 Token 市场上往往会遇到很大挑战。
在供给侧,全球有数十家模型提供商,它们的成本结构并不相同。文章提到,OpenAI 背后的累计投资已达上千亿美元;而在开源社区,一些团队只用几百万美元,就能微调出在某些任务上接近前沿水平的模型。
需求侧的问题更复杂。文章举例称,法务部门本月可能消耗 5000 万 Token 审合同,下月可能涨 3 倍;工程团队部署几个智能体后,Token 消耗量可能在一周内暴涨 10 倍,而企业事先无法预测哪个部门、何时、会产生多大消耗。与传统采购可以汇总相对稳定的年度需求计划不同,Token 需求天然呈现碎片化、波动剧烈且不断膨胀的特征。
在定价方面,文章指出,最简化的竞争模型通常假设,在充分竞争、产品同质且企业可自由进入退出的条件下,价格会受到边际成本和长期平均成本约束。但 Token 市场很难满足这些前提:不同厂商的单位推理成本、资本开支摊销、模型能力和服务质量差异很大,而能力价格又在快速下行。企业甚至无法确定,下个季度同样的预算究竟能买到什么水平的能力。
价值评估则是另一层困难。文章写道,同样 1000 万个 Token,律师用来审合同,可能规避了价值上百万美元的法律风险;市场部门用来写周报,可能只节省了半小时工时。单个场景可以计算投入产出,但很难用统一口径衡量所有场景的 Token 投入,而 CFO 又往往要求给出一个“企业 Token ROI”。
传统前提在 Token 市场中被同时拉扯
文章将上述困惑归纳为:Token 同时在多个维度上偏离了传统经济分析中最常用的简化前提,而且这些偏离恰好在同一时期发生,并相互放大。
首先,同等数量的模型调用,在计量口径上近似相同,但进入不同任务后产生的经济价值却可能相差几个数量级。传统商品也存在使用场景差异,但很多质量差异已经在生产端被标注、分级并进入价格;Token 的难点在于,调用前只能看到模型、上下文和价格,最终价值却要在具体任务中才显现出来。文章认为,这把“同质计量”和“异质价值”之间的张力推到了极端。
其次,成本以每年跌幅超过 90% 的速度下行,但物理基础设施扩张跟不上这一节奏。算法效率可以在硬件不变的情况下独立提升,而晶圆厂从动工到投产需要 3 至 4 年。文章将其概括为,两套速率完全不同的时钟在同时运转。
再次,Token 的调用决策正在部分从人类手动提问,转向由 Agent 和工作流在既定目标下持续触发。当 Agent 开始在既定目标下决定调用什么模型、消耗多少 Token,需求对价格、延迟、失败率和任务价值的反应速度,就会与常见消费品市场明显不同。
文章还指出,现有贸易和监管框架也常常难以归类一次 Token 消耗。一次服务同时包含算力输出、数据处理和智力生成,而现有框架通常分别处理这些问题,Token 则把三者压缩进同一次服务交付。
在文中看来,这些问题各有成因,但组合效应远大于各部分之和。单位价格下降和能力提升,加速了 Agent 进入工作流;Agent 的持续执行放大了需求;需求爆发暴露了物理供给瓶颈;供给瓶颈又反过来改变价格、模型选择和应用门槛。
文章称需要重新校准分析工具
文章最后表示,经济学曾解释过电力、半导体、互联网等通用技术扩散中的价格、投资和竞争问题。每一次新技术出现,既有框架都会遇到边界,随后也会发展出新的分析工具。这一次也不会例外,但需要调整的幅度可能更大。
按文中说法,电力让能源可以远距离交易,半导体重塑了计算成本,互联网改变了信息分发;这些变化都很深刻,但通常没有把“同一计量单位下高度异质的智力成果”“系统作为连续调用主体”“算法效率与物理基建两套时钟”同时叠加在一起。Token 则把这些变化压到了同一个市场里。
文章同时强调,这并不意味着传统经济学是错的。供需平衡、边际分析、交易成本理论,在各自适用范围内依然成立;但如果不先检查这些工具依赖的前提条件,直接照搬到 Token 经济,就容易误判其运行方式。当分析对象从物质商品变成机器处理智力任务的产出,原本稳健的前提假设不再自动成立,建立在这些假设之上的工具也需要重新校准。
这篇文章为腾讯研究院新书《Token 经济》导言,来源于微信公众号“腾讯研究院”,作者署名为腾讯研究院。

