下一代AI训练范式:从RLVR到真实世界持续学习
知名AI研究者Dwarkesh Patel近期提出,当前主流AI训练范式依赖可验证奖励强化学习(RLVR),在封闭环境中通过预设奖励函数引导模型行为。然而,这种方法难以处理开放世界的复杂任务。Patel认为下一代AI训练应超越RLVR,转向在真实世界任务中持续学习——模型在实际部署中不断积累经验,并将这些经验高效沉淀回模型权重,形成闭环进化。
这一转变的核心在于“发布后基础”而非“发布前训练”。Patel指出,传统AI模型在发布后几乎停止学习,而未来AI应具备持续适应能力,从每次交互中提取有效信号,实现自我迭代。这种范式对算力调度、数据隐私和模型所有权提出了新要求,也为与区块链结合的去中心化AI网络提供了理论支撑。
关键路径:可磨性、OPSD与Dreaming模拟训练
Patel强调了三项技术关键:首先是“可磨性”(grindability),指模型能够长期、稳定地在真实环境中运行并持续优化,而非一次训练后固定不变。其次是on-policy self-distillation(OPSD),即模型在自身策略下生成的样本中进行自我蒸馏,从而提升泛化能力,避免过时行为固化。第三是“dreaming”模拟训练,模型在虚拟环境中主动探索和试错,形成类似人类“思维演练”的机制,加速经验内化。
这些方法共同指向一个目标:让AI像人一样,边干活边学习,不再依赖预标注数据或仿真环境的单纯反馈。对于加密行业,OPSD和dreaming的算力需求可能催生新的分布式计算市场,而可磨性模型则有助于构建去中心化自治组织中的智能代理,实现链上治理的持续优化。
对Web3与去中心化AI的潜在影响
Patel的框架对Web3去中心化AI网络具有启示意义。若AI模型需要“发布后持续学习”,则其训练过程必然需要动态、可信的算力与数据源。区块链的不可篡改与激励机制可以为此提供基础设施:模型权重更新可上链存证,OPSD过程可通过智能合约验证,dreaming模拟训练可借助分布式GPU网络完成。此外,去中心化身份与隐私计算能保护模型在真实任务中涉及的用户数据。
尽管该范式目前处于理论探索阶段,但多家去中心化AI项目已开始关注类似方向。Patel的观点为聚合算力、数据市场和模型市场提供了更具体的应用场景。未来若实现从RLVR到OPSD/dreaming的跨越,去中心化AI基础设施将获得更大的价值捕获能力。

