Dwarkesh Patel:下一代AI训练应走向真实世界持续学习,OPSD与Dreaming成关键路径

Dwarkesh Patel:下一代AI训练应走向真实世界持续学习,OPSD与Dreaming成关键路径

N
News Editor
2026-06-29 00:01:37
AI研究者Dwarkesh Patel提出,超越当前可验证奖励强化学习(RLVR)的下一代AI训练范式,应转向在真实世界任务中持续学习并将经验沉淀回模型权重。他强调“可磨性”、on-policy self-distillation(OPSD)和“dreaming”模拟训练等技术路径,推动AI从发布前训练转向发布后持续进化。这一理念对去中心化AI算力网络、链上智能代理等Web3场景具有潜在影响。
AI训练范式强化学习OPSDDreaming模拟可磨性去中心化AIWeb3算力市场

下一代AI训练范式:从RLVR到真实世界持续学习

知名AI研究者Dwarkesh Patel近期提出,当前主流AI训练范式依赖可验证奖励强化学习(RLVR),在封闭环境中通过预设奖励函数引导模型行为。然而,这种方法难以处理开放世界的复杂任务。Patel认为下一代AI训练应超越RLVR,转向在真实世界任务中持续学习——模型在实际部署中不断积累经验,并将这些经验高效沉淀回模型权重,形成闭环进化。

这一转变的核心在于“发布后基础”而非“发布前训练”。Patel指出,传统AI模型在发布后几乎停止学习,而未来AI应具备持续适应能力,从每次交互中提取有效信号,实现自我迭代。这种范式对算力调度、数据隐私和模型所有权提出了新要求,也为与区块链结合的去中心化AI网络提供了理论支撑。

关键路径:可磨性、OPSD与Dreaming模拟训练

Patel强调了三项技术关键:首先是“可磨性”(grindability),指模型能够长期、稳定地在真实环境中运行并持续优化,而非一次训练后固定不变。其次是on-policy self-distillation(OPSD),即模型在自身策略下生成的样本中进行自我蒸馏,从而提升泛化能力,避免过时行为固化。第三是“dreaming”模拟训练,模型在虚拟环境中主动探索和试错,形成类似人类“思维演练”的机制,加速经验内化。

这些方法共同指向一个目标:让AI像人一样,边干活边学习,不再依赖预标注数据或仿真环境的单纯反馈。对于加密行业,OPSD和dreaming的算力需求可能催生新的分布式计算市场,而可磨性模型则有助于构建去中心化自治组织中的智能代理,实现链上治理的持续优化。

对Web3与去中心化AI的潜在影响

Patel的框架对Web3去中心化AI网络具有启示意义。若AI模型需要“发布后持续学习”,则其训练过程必然需要动态、可信的算力与数据源。区块链的不可篡改与激励机制可以为此提供基础设施:模型权重更新可上链存证,OPSD过程可通过智能合约验证,dreaming模拟训练可借助分布式GPU网络完成。此外,去中心化身份与隐私计算能保护模型在真实任务中涉及的用户数据。

尽管该范式目前处于理论探索阶段,但多家去中心化AI项目已开始关注类似方向。Patel的观点为聚合算力、数据市场和模型市场提供了更具体的应用场景。未来若实现从RLVR到OPSD/dreaming的跨越,去中心化AI基础设施将获得更大的价值捕获能力。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。