Dwarkesh Patel 提出下一代AI训练新范式:实景学习、OPSD 与“做梦”模拟,推动AI从预训练走向持续进化
Dwarkesh Patel 认为,下一代 AI 训练应超越当前的可验证奖励强化学习(RLVR),转向在真实世界任务中持续学习,并将经验沉淀回模型权重。他提出“可磨性”(Malleability)、on-policy self-distillation(OPSD)和“dreaming”模拟训练三大关键路径,推动 AI 从发布前训练走向发布后持续进化。这一视角可能影响去中心化 AI 和链上智能体的训练范式。




