Galaxy研报详解“推理资本市场”:GPU期货、代币化推理与链上信贷并行成形

Galaxy研报详解“推理资本市场”:GPU期货、代币化推理与链上信贷并行成形

N
News Editor
2026-07-16 04:54:26
Galaxy Digital 研究副总裁 Lucas Tcheyan 发布长篇研报,系统梳理“推理资本市场”的链下与链上版图。报告称,推理已超过训练,成为全球 GPU 需求的主导力量,ICE、CME 与多家指数提供方正推动 GPU 期货落地;链上侧则出现 Venice、Pearl、Ambient、USD.AI 等不同路径,分别尝试把推理访问权、推理生产和 GPU 硬件融资纳入金融层。报告同时指出,这一市场仍处早期,真实需求、代币价值闭环和执行风险仍待验证。
Galaxy DigitalAI推理GPU期货VenicePearlAmbientUSD.AI算力金融化

Galaxy Digital 发布最新研究报告,试图为“推理资本市场”搭出一张完整地图。报告作者为 Galaxy Digital 研究副总裁 Lucas Tcheyan,中文编译版本由深潮 TechFlow 发布。报告把这个概念定义为一套正在成形的系统:网络、协议、基础设施和应用把 AI 模型推理从 OpenAI、Anthropic 等前沿实验室以及超大规模云服务商主导的中心化 API 里抽离出来,在链上完成协调与结算,并在其上叠加金融层。

按照报告的描述,用户可以把提示词发送给由加密代币激励协调的 GPU 运营商网络,在某些配置下,还能获得关于输出正确性和隐私的密码学或经济担保。

推理需求上升,成为 GPU 需求核心

报告称,这个类别在 2026 年获得越来越多关注。推理,也就是用训练完成的 AI 模型处理新数据并生成输出,已经超过训练,成为全球 GPU 需求的主导部分。与此同时,自主代理作为一类新的推理消费方开始出现,这类系统能够以程序化方式付费,并在运行过程中不需要人工介入。

过去几年,去中心化 GPU 市场、推理协议、支付通道、代币化工具、资本形成工具和链上流动性分别经历过各自的发展阶段。报告认为,新变化在于这些原语正开始融合成一个集成系统,也就是“推理资本市场”。随着推理越来越多地被用于各类工作,这个市场预期会面对持续增长的需求,而且链上的实验正在围绕具备生产力和经济意义的活动展开,需求并不只来自加密行业内部。

推动这一融合的第一股力量,是 GPU 使用正从训练向推理明确转移。报告提到,开源权重模型在“够用就好”的任务层级上正追赶前沿模型,这使得过去成本较高的任务可以被路由给最便宜的服务方,不论该服务是否通过加密网络提供。推理需求增长也在迫使用户主动寻找更多算力来源。Citadel 最近发布的一份报告显示,以 Silicon Data LLM 指数衡量的 token 支出正在下降,反映用户正转向成本更低的模型。这里的 AI token 指 AI 公司用于服务定价的单位,并非加密代币。

报告还提到,Coinbase、微软、AirBnB 等公司最近开始转向使用开源模型,其中以中国模型为主。OpenRouter 最近的融资也被报告视为一个信号,说明市场对多元模型接入的需求在增长,而这有助于让推理变得更便宜。报告认为,这在一定程度上也是供给受限的结果,芯片短缺抬高了边际推理成本。

第二股力量来自金融化。报告称,AI 的普及以及它作为几乎所有任务输入智能的角色,正在催生对其商品化和金融化的需求。越来越多团队在研究如何把 AI 算力转化为一种可交易资产,并纳入更广泛的金融层。推理资本市场的早期框架因此开始浮现,目标是把 AI 硬件和产能金融化,并最终拼装成一个完整市场。

GPU 指数与期货市场先在链下形成

在转向链上推理资本市场之前,报告先梳理了链下 GPU 期货的进展。Galaxy 认为,这是更大的基础市场。

关于 AI 基础设施投入规模,报告列出多家机构的估算。摩根士丹利预测,到 2028 年全球数据中心资本支出约为 2.9 万亿美元,不含电力投资,其中约 2.5 万亿美元与 AI 相关。麦肯锡估计,到 2030 年数据中心需要 6.7 万亿美元全球资本支出,其中 5.2 万亿美元用于 AI 处理设施,1.5 万亿美元用于传统 IT,其 AI 场景区间从受限需求下的 3.7 万亿美元到加速需求下的 7.9 万亿美元。高盛则估计,2026 年至 2031 年间 AI 基础设施资本支出约为 7.6 万亿美元,覆盖算力、数据中心和电力。虽然具体数字不一,但这些预测都把算力和硬件列为最大支出类别,占比在 55% 到 67% 之间。

报告认为,这些预测难做,原因在于供需两侧都有不确定性。一是需求弹性。如果更便宜的算力被重新投入更大模型和更广部署,而不是直接转化为成本节省,效率提升就不会压缩账单,反而会扩大使用量。二是芯片有效寿命难以评估,折旧估算从 3 年到 7 年不等。新芯片每年都在更新,但旧芯片并没有迅速失去价值,因为供给约束依然严重,旧硬件仍可服务较低层级的模型。报告据此判断,大量资本持续流入一种波动性资产,而这正是定价、对冲和融资市场形成的条件。

报告援引 Baseten 的表述称,今天的算力采购“像毒品市场——你有一个‘人’,需要货的时候就打电话”。在 Galaxy 看来,这类市场其实已经存在,只是仍未标准化。大买家正通过私下协议锁定未来算力,从按小时租用到多年期预留合同,再到供应商与大客户之间的双边交易,定价通常缺乏透明度,且明显依赖关系网络。OpenAI 等前沿实验室会批量出售 token,超大规模云服务商彼此预留产能,新型云服务商则会从云平台和经纪商处前向采购。

Galaxy研报详解“推理资本市场”:GPU期货、代币化推理与链上信贷并行成形 3

报告指出,那些从不透明中获利的公司,没有充分动力用透明化屏幕交易换取有限的效率提升。它把这种阻力类比为液化天然气交易所多年来难以建立的原因之一。GPU 期货因此不是产能配置方式的替代品,而是建立在这一碎片化基础上的标准化层,主要作用是转移价格风险。

期货要真正运行,还需要可靠指数。报告称,对算力而言,这比一般大宗商品更难,因为“GPU 小时”如果不说明芯片型号、内存和网络配置、区域以及是按需还是预留,几乎没有意义。电力、带宽和液化天然气在形成流动市场前也有类似问题,解决方式都是定义等级和参考价格,而不是要求每个单位完全相同。原油有 WTI 和布伦特,天然气有 Henry Hub。

报告称,GPU 市场也开始向类似结构靠拢。Ornn 是 Galaxy 投资组合公司,已经推出基于实时交易数据的算力价格指数。Silicon Data 在彭博终端每日发布 H100、A100 和 B200 租赁指数,把不同配置、供应商和区域的数据归一化成统一基准。Compute Desk 也在建设类似产品。用 Ornn 的框架来讲,这些指数更像 SOFR,而不是曾经因定价机制争议闻名的 LIBOR。因为它们基于广泛的真实交易数据,而不是专家估值,追踪的也不是单一 GPU,而是一组已定义算力的市场价格。

不过,报告也强调,GPU 基准与原油不同。WTI 的标准桶不会变,但 GPU 基准会随着 H100 迭代到 H200、B200、GB200,再到 Rubin 而不断衰减,参考标准必须随代际更替重写。市场碎片化也在加剧这一难题,AMD、Google TPU、Amazon Trainium、超大规模云自研芯片和主权芯片都在分散需求,且它们并不兼容。

另一个争议点是结算方式。对于需要对冲算力预算的实验室和进行方向性交易的交易台,现金结算合约已经足够,因为它们只需要价格敞口。但对新型云服务商来说,真正需要的往往是产能本身。目前已推出的 GPU 期货主要以现金结算为主,原因是价格对冲最容易标准化。报告同时提到另一种看法:在少数卖家控制供给的情况下,基于薄弱指数的现金结算容易被操纵,大宗商品市场通常需要实物交割,或至少需要可运作的期现转换机制,才能让价格与现实收敛。

参与者结构也同样关键。报告把买方分为 AI 实验室、应用公司,以及已经向下游承诺产能、需要保障输入的新型云服务商;卖方则包括持有 GPU 库存、但未来用途并不确定的超大规模云服务商、大型 GPU 持有者和经纪商。为 GPU 采购提供融资的放贷方也需要参考价格,因为以折旧中的硬件为担保的债务必须有可标记的估值基准。投机者和自营交易公司则负责增加流动性。当前最主要的结构性张力,是卖方通常想卖长期合约来锁定收入,而买方更想买短期合约以保留灵活性。

尽管如此,报告认为一个更成熟 GPU 市场的早期迹象已经出现。预测市场平台 Kalshi 已推出特定 GPU 价格市场。纽交所母公司 ICE 与 Ornn 合作,CME 与 Silicon Data 合作,也已经宣布计划在未来一年上线 GPU 期货。报告将其概括为:“算力即商品”正在变成现实。

链上推理资本市场:从模型输出到金融层

Galaxy 在报告中提出,模型与推理供应商本质上是“token 工厂”。它们接受原始输入,也就是 GPU,然后把其精炼为 token 形式的输出。GPU 小时正在借助指数日益标准化,但上层 token 的定价体系尚未成熟,不同模型的 token 价格差异很大。不过,这一层已经开始搭建。报告提到,中国三大国有电信运营商已经开始把推理作为计量型公用服务零售,销售标准化月度 token 套餐,形式类似手机流量套餐。亚马逊据报道将开始按照消耗的 token,而不是预先承诺的计算小时,向 Anthropic 付费。上海期货交易所则据说正在早期设计 AI token 期货,以对应 CME 和 ICE 在输入端构建的 GPU 合约。

加密行业正在搭建自己的版本。报告称,这些链上推理资本市场建立在既有的加密与 AI 原语之上,包括 GPU 供应商和去中心化模型开发者,也纳入了代理支付标准、代币化推理市场等新兴垂直赛道。生态分布在多条链和执行环境上,但 Base 与 Solana 的开发更为集中,原因在于它们已有成熟的开发者和用户基础。

报告把生态核心放在推理供应商和推理网络上,它们负责把提示词转成输出。围绕它们的则是模型开发者、GPU 与算力供应商、路由器与市场、代理与应用、支付通道以及资本形成基础设施。按照这份报告的分类,这些外围层的重要性在于,它们要么创造推理需求,要么提供推理输入,要么把推理使用转化成可支付、可融资、可路由、可拥有的对象。

Galaxy研报详解“推理资本市场”:GPU期货、代币化推理与链上信贷并行成形 4

其中不少产品并非加密独有,而是有链下对应物。报告举例称,在应用层,Hermes 和 Ironclaw 这样的代理框架,可以在前沿实验室和 Venice 等链上供应商之间切换推理服务;Nous Research 等去中心化开发者的模型,也可以通过 OpenRouter 访问。GPU 供应商可以视为超大规模云和数据中心的无许可、开源版本,只是体量通常更小。x402 和 MPP 等代理支付协议既可以为 OpenAI 或 Anthropic 订阅付费,也可以为 Venice 付费。程序化结算正在成为行业标准,而不再是加密独享的能力,OpenAI 和 Visa 最近也宣布了自己的代理支付基础设施。

真正具有差异性的部分,出现在金融化一侧。报告认为,加密改变的是推理如何被拥有、定价和融资。围绕这一点,市场上出现三类链上项目:

  • 推理服务供应商,如 Venice 和 Morpheus,把未来推理访问权代币化,使其成为可以持有、定价和转售的资产;
  • 有用工作量证明项目,如 Pearl 和 Ambient,把推理生产本身代币化,用代币排放补贴服务推理的成本;
  • 信贷供应商,如 USD.AI,不直接代币化推理,而是为运行推理所需的硬件提供融资,用稳定币存款支持 GPU 和数据中心贷款。

报告把这三部分合起来,称为链上推理资本市场。

推理供应商:OpenRouter 显示初步牵引力,Venice 走得更远

在推理供应商这一层,用户或开发者选择模型、发送提示词,并按 token、请求或订阅付费,随后获取输出。最简单的形态与 OpenRouter、Together AI、Fireworks 或前沿实验室 API 相似。区别在于,加密原生供应商可能通过去中心化 GPU 网络获得产能,接受稳定币或代币付款,提供开放或无审查模型访问,也可能加入隐私保障和代币化访问权。

报告称,OpenRouter 是观察链上推理最有利的位置之一,因为那里的需求按 token 定价,用户可在单次请求上自由切换供应商,这种环境最有利于更便宜或更快的供应商争夺份额。过去三个月,链上供应商处理的 token 占 OpenRouter 日处理总量的 0.5% 至 1%,而同期 OpenRouter 总 token 量持续爆发式增长。报告据此判断,这显示出一些来自加密原生社区之外的早期牵引力,但在总使用量中占比仍小,说明链上供应商暂时还无法在分发、成本或其他方面,与成熟的中心化产品正面竞争。

不过,仅看 OpenRouter 并不完整。报告举例称,Venice 在 6 月 23 日报告,其所有接入点合计处理了 1000 亿个 token,大约是它在 OpenRouter 上处理量的 10 倍。因此,如果只用 OpenRouter 的份额衡量项目热度,会低估实际体量。报告提到,链上推理供应商正在用不同方式建立稳定客户群。Venice 把隐私作为核心卖点之一,强调用户不必担心供应商保留、检查、泄露、审查或被迫披露敏感信息。Chutes 和 AkashML 则允许任何人把 GPU 接入网络并将闲置算力变现,希望借此压低成本。报告同时提醒,这类功能虽然可能帮助供应商争取部分市场,但很多能力也能被中心化供应商复制,未必足以换来显著市场份额。

Galaxy 认为,链上产品真正有机会形成差异化的地方,是金融化推理的机制,也就是把访问权变成可以买入、持有和转售的资产,而不是只能消费一次的订阅。

Venice:把推理访问权做成可拥有资产

报告把 Venice 视为在“把推理访问权变成可拥有资产”这条路上走得最远的项目。Venice 由 Erik Voorhees 创立,运行 VVV 和 DIEM 的双代币系统,把未来推理索取权包装为可铸造、可持有、可转售的资产。

在这套机制中,VVV 被定义为项目的“资本资产”。它并不代表 Venice 平台所有权,Venice 仍有独立股权。报告提到,2026 年 6 月,Venice 完成 6500 万美元 A 轮融资,估值达到独角兽水平。VVV 持有者理论上可以从项目成功中受益,最直接方式是 Venice 会把部分收入用于回购并销毁 VVV。回购与销毁包括两种形式:一种是由一般收入出资的自由裁量销毁,另一种是每笔新订阅收入中固定比例被程序化用于回购销毁。报告称,截至撰写时,42% 的 VVV 已被销毁。

VVV 还有实用功能。任意数量的 VVV 都可以质押,以获得年度 VVV 排放;用户也可质押 100 枚 VVV 解锁 Pro 订阅。更关键的是它与 DIEM 的关系。DIEM 被 Venice 设计为“算力资产”。持有人锁定已质押的 VVV 后,可以铸造 DIEM,而每个 DIEM 永久授予 1 美元的 Venice 推理积分。持有 100 个 DIEM,就等于拥有 100 美元的 API 积分,可用于 Venice 平台上的所有模型,且永久有效,至少在 Venice 平台持续运营的前提下如此。

Galaxy研报详解“推理资本市场”:GPU期货、代币化推理与链上信贷并行成形 5

每个 DIEM 所需锁定的已质押 VVV 数量,遵循一条由 Venice 设定的曲线。随着 DIEM 供应量接近 Venice 控制的目标,该成本会指数级上升。报告解释称,这是因为每个 DIEM 都意味着 Venice 账簿上一项每日 1 美元的永续负债。由于当前供应量接近目标,铸造费率已从推出时约 90 VVV/DIEM 升至如今的数百 VVV/DIEM。结果是发行受到抑制,早期铸造者得以以远低于当前条件的成本获得 DIEM。VVV 被锁定用来支撑 DIEM 时,质押者只保留常规 VVV 质押收益的 80%,另外 20% 归 Venice。锁定只能通过销毁 DIEM 来释放,因此铸造者如果已把 DIEM 卖出,之后要想赎回 VVV,就必须再从市场买回 DIEM,一旦价格上涨,就会产生亏损。

报告认为,这两个代币之间存在相互增强关系。DIEM 只能通过锁定已质押的 VVV 来铸造,因此 DIEM 需求增加会把 VVV 从流通中抽走,让 VVV 拥有超出投机之外的用途。反过来,DIEM 的价值又受益于 Venice 平台的成长,因为平台越有用、覆盖面越广,持有者手中的每日访问权索取权就越值钱。DIEM 持有者所拥有的不只是可转售的推理资源,也是一个与 Venice 成功表现绑定的头寸。

Galaxy 在报告中指出,Venice 的产品和代币经济即便面对非加密用户也能运转。Venice 团队称,大多数用户并非加密原生,很多人并不关心代币本身。但他们的订阅、积分购买和平台使用,仍然会驱动 VVV 的回购销毁和对 Venice 推理的需求。按报告的表述,代币经济位于产品之后,而不是拿代币去替代产品本身。

DIEM 的核心特征,是所有权。报告称,它试图让用户拥有自己消费的推理,而不是租用一次性的服务。这为几类场景打开空间。其一,持有人可以保留一部分基线访问权,把暂时不需要的日额度卖掉或出租,从而收回原本在按次付费模式下会直接损失的成本。代理也可以直接持有 DIEM,获得无许可、可拥有的推理余额。交易可以通过 Aerodrome 立即出售,也可以通过 Surplus、UsePod、AntSeed、CarpeDiem 等市场进行固定期限租赁。

报告还提到 Venice 团队常用的另一个案例:用户买入 DIEM,用它做一天推理,第二天再卖掉。如果价格不变,等于免费使用了推理;如果价格上涨,用户甚至还能获利。相反,如果价格下跌,持有者的损失可能远高于直接购买一次推理的成本。报告据此指出,这意味着部分用户会在消费推理的同时承担推理价格投机。

在成本确定性方面,报告称,需求稳定且可预测的企业或代理,可以借助 DIEM 锁定其算力成本,逻辑与多年期云预留合同类似。报告以 7 月 7 日的 DIEM 价格 1270 美元为例,称一个 DIEM 大致相当于四年的每日 1 美元积分,也就是买家预付了大约三年半的永续现金流。但报告随即指出,买方为此需要持有一个以美元计价、且高度波动的永续资产,这与其寻求确定性的初衷并不完全一致。按永续承诺的定价方式来看,DIEM 隐含了对 Venice 持续运营能力的两位数折现率,而该索取权的价值,完全取决于 Venice 能持续提供服务多久。

Galaxy 还列出 DIEM 机制当前的几个缺陷。首先,代币化推理更适合那些需要提前拉动需求和筹资的发行方。拥有最好模型和强定价权的实验室,没有太强动力去代币化访问权,因为那会削弱其客户间价格歧视、损失未使用积分带来的收入,并降低后续重新定价的灵活性。其次,DIEM 没有到期日,无法让持有人收回本金,也没有抵押品或储备金支撑,不像 GPU 抵押贷款那样具备明晰担保结构。它本质上是一个开放式头寸,押注 Venice 多年之后仍会兑现每日 1 美元的服务承诺,一旦平台不能持续服务,持有人没有契约或追索权。再次,DIEM 代表的是对 Venice 所定义“1 美元推理可购买什么”的索取权,而不是对固定数量推理的索取权。各模型 token 定价由 Venice 自行决定,且可能随着需求和可用性波动,因此风险不仅来自市场方向,也来自平台与持有人之间的自由裁量。

更深一层的问题是,买家真正想要的,究竟是不是 DIEM 这种永续、美元计价的敞口。报告提出,市场或许更需要一种带期限、以算力或 token 计价,或者两者结合的索取权。

报告称,目前 DIEM 主要仍被当作投机资产持有,而不是主要用于推理访问。每周被实际用于推理的额度,不到已发放量的 50%。Venice 自身材料把 DIEM 定义为一种“区间震荡的永续资产”,并把买家分成 API 用户、在不出售 VVV 的情况下提取价值的 VVV 持有者,以及做套利价差的投机者,其中后两类占比较大。报告把最接近的中心化类比描述为 OpenAI 的 Scale Tier:固定期限、按 token/分钟购买模型吞吐能力的预付承诺,但它是绑定账户、不可转让的内部产能。DIEM 的方向则恰恰相反,可被持有、转售,并与加密推理堆栈组合。Galaxy 认为,更好的工具可能会把 Scale Tier 的期限结构和算力计价方式,与 DIEM 的所有权和可转让性结合起来。

从 Venice 一侧看,每一个流通中的 DIEM 都代表 1 美元该平台必须持续服务、并且无法再卖给其他人的算力,构成了一项负债。这也是 Venice 要用收入持续回购代币的原因。报告强调,VVV 和 DIEM 不是 Venice 股权的替代工具,它们最初是作为引导平台用户增长的机制,如今价值则来自其所提供的算力索取权。报告把这种结构理解为:一方持有索取权,希望其升值;另一方承担服务义务,希望可控管理负债。这种围绕 Venice 算力形成的共享头寸,而不是股权利益,才是两边对齐的基础。

Pearl 与 Ambient:代币化推理生产

如果说 Venice 代币化的是推理访问权,那么 Pearl 和 Ambient 代表的是另一条路线:代币化推理生产本身。报告将其归类为“有用工作量证明”。这一思路是用代币排放补贴服务推理的成本,使保护网络安全的计算工作与客户真正愿意支付的推理工作重合。

Galaxy研报详解“推理资本市场”:GPU期货、代币化推理与链上信贷并行成形 6

Pearl:把矩阵乘法嵌入挖矿

Pearl Network 是一条从比特币代码库分叉出来的 Layer 1 区块链,保留了 UTXO 模型和难度调整机制,但把 SHA-256 哈希算法换成了矩阵乘法,而矩阵乘法正是 AI 训练与推理中的核心计算。报告称,Pearl 的设计主张是:服务客户推理的那一次矩阵乘法,也可以同时成为一次挖矿尝试。

具体做法是,当 AI 模型回应提示词时,底层需要进行大型矩阵乘法。Pearl 让矿工把这些矩阵加上一层随机数字后再进行乘法,繁重计算过程被提交进挖矿竞赛。执行中,中间结果会被不断检查是否低于难度目标;如果低于,矿工获得区块,与比特币的规则类似,只是这里被检验的工作不是无意义哈希,而是服务模型的真实计算。乘法完成后,系统再通过一个快速步骤去掉随机层,得到客户所需的精确推理结果。也就是说,一次计算同时产出两个结果:一份真实 AI 输出,以及一次赢取区块奖励的机会。

报告指出,两项设计让这一机制具备可行性。第一,Pearl 以 vLLM 插件形式发布,而 vLLM 本就是 AI 公司常用的软件,因此供应商可直接启用,而无需重建底层系统。第二,由于区块获胜条目需要向网络公开验证,Pearl 使用零知识证明封装结果,以隐藏客户提示词和供应商的专有模型权重。按照 Pearl 的说法,这一额外开销很小,增加的工作量在 0.5% 到 10% 之间;在其对 Llama-3.3-70B 的发布测试里,Pearl 版本的速度与标准版本持平,甚至在某些配置下更快,因为团队对核心计算做了重新工程化。

不过,报告也指出 Pearl 目前的核心缺陷:协议无法区分“有用”的计算和“无用”的计算。无论客户是否真的需要那次结果,只要矿工执行矩阵乘法,计算就是有效的。Pearl 白皮书本就假定会存在一群只为了赚区块奖励而运行无用计算的矿工。发布后的实际情况也验证了这一点。早期挖矿热情让网络算力迅速攀升,但真正服务实际推理需求的迹象极少。

即便如此,报告认为 Pearl 也开始出现一些现实牵引力。最重要的一项进展发生在 5 月,Pearl 宣布与 Together.ai 合作,后者是领先的推理和算力供应商之一。双方推出一个推理端点,其价格比 Together 标准费率低 25% 以上,折扣由同一算力上赚取的 Pearl 代币奖励补贴。Galaxy 判断,Pearl 的双用途设计,只有在算力由真实付费推理需求驱动时,才会产生真正有用的工作。缺少这种需求时,区块奖励吸引来的只是投机矿工,最终结果不过是另一种形式的类比特币 PoW,没有生产性输出。

Ambient:用拍卖把挖矿与真实需求绑定

Ambient 的设计与 Pearl 相反。它不是让矿工运行任意模型,而是把整个网络标准化为一个大型开源权重模型,并围绕验证该模型输出建立共识。

在 Pearl 的结构里,矿工通过蛮力方式围绕同一个问题竞争;Ambient 则让矿工通过拍卖争取任务。用户或代理会发布一个带有截止时间和价格的推理任务,相当于“在 X 分钟内完成这个,我支付 Y”,矿工则竞标承接。中标矿工在网络模型上执行查询,并提交保证金,如果未按时交付,保证金将被没收,用以保证质量和时效。一组随机抽选的验证者负责检查结果,这些验证者的优先级不是按质押资本,而是按有用工作历史加权。由于矿工各自服务不同任务,而不是所有人争夺一个区块,网络避免了传统 PoW 的瓶颈。Ambient 基于 Solana 分叉构建,把质押换成有用工作,目标是达到 Solana 级别的运行速度。

报告称,拍卖机制也是 Ambient 将推理价格压到有竞争力水平的工具。一般 API 供应商必须从用户支付中回收全部服务成本,而 Ambient 矿工同一单位工作可以获得两次支付:一次来自发布任务的用户或代理,另一次来自协议对经过验证有用工作的奖励。因此,矿工会在竞标时把预期代币奖励扣除后,再以净成本报价,而不是按总成本报价。换句话说,代币排放补贴了供给侧,而拍卖机制促使大部分补贴以更便宜推理的形式传导给需求侧。Galaxy 认为,与一般挖矿补贴相比,这里的关键差异在于,奖励附着在已经有人发布并愿意付费的任务上。如果这一机制有效,那么排放购买到的不是单纯算力,而是更便宜、经过验证的推理,从而吸引更多使用,再给矿工更多工作,反过来加强对网络代币需求的支撑。

Galaxy 认为,这也是 Ambient 自称解决 Pearl 问题的原因。Pearl 中,矿工无论客户是否需要输出,都可以通过矩阵乘法争取区块奖励;而在 Ambient 中,矿工只有赢得有人发布且愿意支付的任务,才能获得代币,挖矿与服务真实推理在设计上是同一件事。

在推理结果验证上,Ambient 也走了不同路线。报告提出一个问题:如果矿工声称它在约定模型上运行了查询,用户如何确认它没有偷偷切换到更便宜、质量更差的模型来节省成本。报告指出,这个问题对中心化供应商同样真实,它们曾被指控为节约成本而悄悄降低模型质量。Ambient 的做法利用了语言模型生成文本时会在每一步产生 logits 的特性。logits 可以理解为模型在选择下一个词之前,对所有候选词给出的原始数值评分,这组评分可视为特定模型的“指纹”,并可进一步哈希成一个短数字用于核验。

Galaxy研报详解“推理资本市场”:GPU期货、代币化推理与链上信贷并行成形 7

在核查一段包含数千个 token 的输出时,验证者不需要完整重跑整个任务。它只要随机选取文本中的一个位置,要求矿工提交该处的“指纹”,再在那个位置重新运行模型生成一个 token,比较指纹是否一致即可。报告称,一次 token 级别的工作,可以验证数千个 token 的输出,逻辑与比特币相似:生产工作昂贵,但验证很便宜。Ambient 称,这把验证成本开销压在约 0.1%,相比其他项目尝试的零知识证明验证方案,开销低约 10 倍到 1000 倍。

“有用工作量证明”仍受制于需求和代币闭环

Galaxy 在报告中指出,这类项目与一般去中心化算力项目的区别,在于保护链安全的工作本身就是客户想购买的工作。若机制成立,同一单位能源同时换来网络安全和一个可销售产品。对供应商来说,挖矿成为其现有硬件上的第二收入来源;对购买方,输出也足够可验证,代理无需完全信任供应商,就能购买推理。

问题在于,如果真实需求不足,区块奖励本身就足以吸引矿工,工作量证明网络会充满不服务任何客户的算力,看起来“有用”,实际并无外部生产价值。

报告把当前问题归纳为两类。第一是需求。去中心化推理网络面对的竞争对象,既有中心化推理供应商,也有单纯 GPU 租赁服务,这两类产品通常更便宜、更快,而且不要求用户接触加密代币。要在这种环境中取胜,这些网络必须服务一类明确需要“最小信任化推理”的买家,也就是需要可验证、抗审查、中立、且不担心供应商跑路的推理服务。Galaxy 判断,当前愿意为这些属性付费的需求切片还很小,但如果这些项目能证明自己能以更低成本持续、稳定地提供推理,或者市场对中心化 AI 的信任被削弱,需求规模可能迅速扩大。Pearl 的发布在报告里被作为警示案例:如果没有足够真实需求,区块奖励会独立吸引矿工,最终让网络充满不服务客户的算力。

第二个问题是代币价值积累。报告称,每个项目都试图讲出一套飞轮逻辑:真实使用推动代币需求,代币再为保护网络的挖矿奖励提供资金,进而支撑更多使用。但目前没有一个项目真正闭合这条路径。矿工会获得新铸代币,然后卖出以覆盖成本;需求侧却没有明确机制要求买家必须购买代币,因为消费真实产品——无论是推理还是证明——大多不需要大规模使用加密代币。报告举例称,Pearl 的推理可以用美元支付,而其提议中的未来市场才打算让代币用于购买算力,这实际上说明循环尚未存在。Ambient 也尚未公布完整代币经济模型,也未说明推理是否以代币计价。因此,当前的代币更多是“被赚取并卖出”,而不是“被使用”。

Galaxy 给出的判断是,最可能的演化方向,是这些网络最终把代币做成推理的原生支付通道。这是闭合循环最直接的方式。只要代币排放能让它们以低于市场价提供推理,而用户又必须用代币付款,那么真实使用就会转化为代币需求。但这一飞轮成立的前提,是持续的、有机的代币需求,最终能够超过排放带来的卖压。

USD.AI:围绕 GPU 硬件的链上融资市场

报告接着讨论推理资本市场的另一层,即为 GPU 硬件融资。与 Venice、Pearl、Ambient 代币化推理不同,Galaxy 认为 USD.AI 是加密在本轮 AI 基础设施中最接近“做自己最擅长事情”的案例:它不依赖额外铸造代币来引导需求,而是以更传统的方式筹集资本、抵押硬件,把稳定币存款导入购买 GPU 的运营商贷款,并由租赁现金流偿还存款人。

报告指出,大型运营商早已通过银行信贷额度、资产支持证券化和私人信贷为其设备融资,CoreWeave 数十亿美元级别的 GPU 支持债务就是典型案例。困难主要出现在体量较小的新型云服务商身上。它们虽然拥有硬件,也持有可支撑贷款的合同现金流,但通常缺少快速获取贷款所需的资产负债表规模、财资能力和放贷方关系。USD.AI 正是在这一缺口上提供贷款。存款人提供资金,租赁收入偿还贷款,利息回流为收益。Galaxy 认为,这套模式有三点是银行较难复制的:放贷资金端对任何持有稳定币的人开放,而不是局限于封闭信贷基金;每一笔贷款都可以成为可在链上被质押、交易或充当抵押品的可组合工具;抵押品索取权虽仍依赖传统法律执行,但在链上已有表示。

USD.AI 运行在两个代币上。存款人铸造 USDai,这是一种由 PayPal 的 PYUSD 支持的合成美元,而 PYUSD 进一步由美国国债和现金支持。USDai 本身不产生收益,设计目标是流动性和可组合性。如果要获取收益,存款人需将 USDai 质押成 sUSDai,后者的价值会随着奖励累积而上升。收益来源有两部分:一是 GPU 借款人支付的贷款利息,二是贷款投放间隔期间闲置储备金产生的国债收益。报告称,在贷款账簿规模约为储备金一半的情况下,质押收益约为 8%,协议目标是在更多资本被部署后,把收益推高到 10% 至 15%。

对以实体 GPU 为抵押的贷款来说,真正困难的是借款人违约后如何执行索取权。报告称,USD.AI 曾把每一台被融资的 GPU 记录为 ERC-721 NFT,并将其描述为《统一商法典》第 7 条下的合法产权凭证,在委托保管安排下由借款人保管机器,以 NFT 作为抵押品。这套框架被协议称为 CALIBER。但协议后来放弃了这一方案,因为它带来了过多商业摩擦。如今,NFT 代表的是贷款记录,负责承载服务条款并在链上路由还款,本身不再转移对抵押品的法律索取权。真正的执行依赖常规链下贷款文件,物理追回则依赖现场检查、安装证明、抵押品监控、留置权备案以及数据中心或托管方配合。Galaxy 明确指出,这条执行路径,以及协议更广泛的模式,都尚未经历完整的不良资产回收测试。

Galaxy研报详解“推理资本市场”:GPU期货、代币化推理与链上信贷并行成形 8

报告同时提醒,流动代币与 3 年期摊销贷款之间天然存在资产负债错配。多数 RWA 信贷协议通过承诺即时赎回来掩盖这一问题,但在压力时会暴露,USD0++ 脱锚就是报告举出的例子。USD.AI 的做法是不承诺即时退出,赎回在 30 天周期内按已摊销本金清算,遵循先到先得原则。协议不会为了满足提款,去强行清算一笔仍正常运行的贷款。在此之上,协议还引入了一个借鉴 Flashbots MEV-Boost 设计的定价队列,允许希望插队赎回的用户竞价获得优先权,相关费用则分配给继续等待的持有者。贷款条款方面,报告称其结构接近 CMBS,包括 70% 至 80% 的贷款价值比、约三个月债务服务覆盖的借款人储备金、两次错过付款后清算,以及对硬件的保险、监控和通过专业合作伙伴回收。

Galaxy 把 USD.AI 纳入本报告,还有一个原因:它把信贷层和定价层连接了起来。给 GPU 融资的放贷方需要某种标尺来给抵押品做估值,包括硬件折旧速度、强制出售价值、安全预付比例以及残值对冲方式。算力指数和正在形成的期货市场,正为这些问题提供参考;而放贷方反过来又为价格体系提供了真实、非投机性的信用敞口。报告强调,GPU 放贷方真正关心的,不是某一天的现货租赁价格,而是在贷款违约时这台机器能卖多少钱。流动的指数和期货曲线,最终应该能回答这个问题。

根据报告,USD.AI 表示其约 95% 的贷款账簿由长期承购合同而非现货租赁支撑,因此借款人的还款能力更多取决于已预先锁定的产能交易对手,而非日度租赁价格。存款人当前面临的风险前方还有两道缓冲。第一,协议会快速去风险化每一笔贷款。70% 至 80% 的 LTV,加上预先出资的三个月债务服务储备金,使实际发放时的有效 LTV 降至 60% 多。USD.AI 称,约四分之一到三分之一的贷款会在第一年内偿还,因此在硬件价值明显下跌前,协议就能回收大量风险敞口。第二,每笔新贷款现在都附带 Barkr 的价值损失保险,其 AI 驱动的抵押品估值由慕尼黑再保险担保并再保险。若贷款违约且抵押品出售价格低于 Barkr 评估值,差额会支付给协议。基于 80% 的 LTV 上限,USD.AI 把这描述为对未偿债务的全额覆盖。

不过,报告也指出,保险只是改变风险分布,并没有消除风险。残值风险被转移给更强的交易对手方,但市场也因此新增了对 Barkr 估值模型和再保险持续有效性的依赖。保障范围和 USD.AI 的链下执行能力,都还没有经过真正违约潮的检验。贷款仍按 3 年摊销,而协议所引用的硬件有效寿命是 7 年;如果硬件迭代周期缩短,这个缓冲区间就会被压缩。Galaxy 认为,相比几个月前,变化在于不良清算现在会先由保险方承担一层损失,再传导到存款人。

Galaxy 的结论:真实需求先出现在融资层,其余部分仍在早期试验

在总结部分,Galaxy 认为,无论链上还是链下,当前的推理资本市场相对整个 AI 产业增长规模仍然很小。链上产品若想扩张,必须证明其所引入的优势具有可持续性。

报告给出的优势主要有三类。第一,Venice 这类代币化访问权,把推理索取权变成持有人可保留、转售、出租、交给代理的不记名资产,而不是绑定在某个供应商可撤销账户上的订阅。第二,Pearl 与 Ambient 这类有用工作量证明,用代币排放补贴推理,把价格压到市场成本以下,并让输出具备可验证性,使买家无需完全信任供应商不会偷换模型。第三,USD.AI 这类融资协议,把原本不流动的 GPU 信贷,变成任何持有稳定币的人都能参与资助和退出的可组合工具。报告还指出,在这三类结构之下,整个堆栈都具备无许可和程序化的特点,而这恰好与代理作为未来重要推理消费者的形态相适配。加密在这里发挥作用的地方,集中在所有权、中立性、可组合性和资本获取上。

阻力同样明确。报告直言,目前没有人真正把对算力的真实需求与对加密代币的真实需求连起来。生产网络会铸造代币并卖出,用排放补贴低于市场价的推理;代币化访问权更多围绕发行方的投机而非实际使用,DIEM 主要被投机者持有,被当作对 Venice 的押注来定价;而融资是少数例外,因为它面对的是真实客户——那些需要资本、且拥有现金流偿还能力的新型云服务商。所以它的收益来自被服务的需求,而不是靠铸造代币去引导兴趣。按报告的说法,到目前为止,金融层在吸引投机资本方面,比在生成自我维持、由使用驱动的需求方面更成功。

Galaxy 进一步提出,链上推理资本市场的真正优势,不在于直接与既有 AI 企业比拼它们最擅长的事情,也就是以低成本大规模提供推理,而在于形成资本并触达那些传统金融处理过慢、规模过小或能力不足的市场。报告把这描述为加密行业不断重复出现的模式:它很少在产品、交易所、模型或应用本身上胜出,却经常成为围绕这些东西搭建金融层的最快方式,无论是资产定价、碎片化、融资还是结算。

在 Galaxy 看来,推理正是这一模式最新、也是体量最大的一次体现。一个数万亿美元级别的资产类别正在实时组装,而围绕算力作为金融资产所需的市场结构——指数、期货、信贷和代币化产能——几乎还不存在。报告认为,这种缺失本身就是机会。融资层之所以目前最先跑通,是因为它是整个结构里第一个找到真实需求的部分;至于堆栈其余部分,仍然是一场押注,赌同样的优势会随着算力本身被金融化,而继续向上延伸。

报告最后写道,推理市场可能还需要数年时间才会成熟,但围绕它构建的金融层,正在现在形成。另据文末更新说明,关于 USD.AI 的部分已在 7 月 15 日更新,以反映协议在执行违约贷款索取权方面的变化。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。