Dwarkesh Patel 提出下一代AI训练新范式:实景学习、OPSD 与“做梦”模拟,推动AI从预训练走向持续进化

Dwarkesh Patel 提出下一代AI训练新范式:实景学习、OPSD 与“做梦”模拟,推动AI从预训练走向持续进化

N
News Editor
2026-06-29 00:31:36
Dwarkesh Patel 认为,下一代 AI 训练应超越当前的可验证奖励强化学习(RLVR),转向在真实世界任务中持续学习,并将经验沉淀回模型权重。他提出“可磨性”(Malleability)、on-policy self-distillation(OPSD)和“dreaming”模拟训练三大关键路径,推动 AI 从发布前训练走向发布后持续进化。这一视角可能影响去中心化 AI 和链上智能体的训练范式。
AI训练实景学习OPSD做梦模拟可磨性Dwarkesh Patel加密AI去中心化智能体

在 AI 与加密技术交汇的前沿,研究学者 Dwarkesh Patel 提出了下一代 AI 训练范式的构想:从预训练走向发布后的持续学习。他认为,当前主流的可验证奖励强化学习(RLVR)虽能有效优化模型在测试环境下的表现,却无法充分适应真实世界中不断变化的动态任务。

实景学习:走出模拟器,进入真实任务

Patel 强调,AI 训练必须从“封闭沙盒”走向“开放世界”。模型应在用户交互、系统反馈、链上操作等真实场景中不断积累经验,并将这些经验回写至自身权重,实现“干活干出来”的进化。这一概念被他称为“可磨性”(Malleability)——模型在部署后仍然具备持续接收并整合新经验的能力,而非冻结在训练时的状态。

OPSD 与“做梦”模拟:高效的持续学习机制

为实现实景学习,Patel 提出两项核心技术路径:on-policy self-distillation(OPSD,在线策略自蒸馏)和“dreaming”模拟训练。OPSD 允许模型在部署后利用自身当前策略对新数据进行蒸馏,避免遗忘旧知识;而“dreaming”则通过生成模拟环境中的高价值轨迹,让模型在虚拟场景中反复试错,从而加速经验沉淀。两者结合,有望使 AI 在不依赖人工标注的情况下持续自我迭代。

对加密行业的影响:链上智能体的训练革命

在加密领域,AI 驱动的智能体(Agent)已在 DeFi、DAO 治理、NFT 交易中崭露头角,但其训练大多仍依赖离线 RLVR 或人工反馈。若 Patel 提出的 OPSD 与实景学习范式落地,未来链上智能体将能够直接在真实交易、治理投票、跨链交互中学习并优化策略,大幅提升适应性与自主性。同时,加密基础设施(如链上数据、预言机、去中心化计算)天然为这种持续学习提供了丰富的环境与验证机制。

目前 Patel 的观点尚处于理论探讨阶段,但其对 AI 训练范式的反思已引发加密社区对“可进化的智能体”的更多讨论。若实景学习与 OPSD 能够与去中心化验证网络结合,或将催生新一代自主进化链上 AI 系统。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。