在 AI 与加密技术交汇的前沿,研究学者 Dwarkesh Patel 提出了下一代 AI 训练范式的构想:从预训练走向发布后的持续学习。他认为,当前主流的可验证奖励强化学习(RLVR)虽能有效优化模型在测试环境下的表现,却无法充分适应真实世界中不断变化的动态任务。
实景学习:走出模拟器,进入真实任务
Patel 强调,AI 训练必须从“封闭沙盒”走向“开放世界”。模型应在用户交互、系统反馈、链上操作等真实场景中不断积累经验,并将这些经验回写至自身权重,实现“干活干出来”的进化。这一概念被他称为“可磨性”(Malleability)——模型在部署后仍然具备持续接收并整合新经验的能力,而非冻结在训练时的状态。
OPSD 与“做梦”模拟:高效的持续学习机制
为实现实景学习,Patel 提出两项核心技术路径:on-policy self-distillation(OPSD,在线策略自蒸馏)和“dreaming”模拟训练。OPSD 允许模型在部署后利用自身当前策略对新数据进行蒸馏,避免遗忘旧知识;而“dreaming”则通过生成模拟环境中的高价值轨迹,让模型在虚拟场景中反复试错,从而加速经验沉淀。两者结合,有望使 AI 在不依赖人工标注的情况下持续自我迭代。
对加密行业的影响:链上智能体的训练革命
在加密领域,AI 驱动的智能体(Agent)已在 DeFi、DAO 治理、NFT 交易中崭露头角,但其训练大多仍依赖离线 RLVR 或人工反馈。若 Patel 提出的 OPSD 与实景学习范式落地,未来链上智能体将能够直接在真实交易、治理投票、跨链交互中学习并优化策略,大幅提升适应性与自主性。同时,加密基础设施(如链上数据、预言机、去中心化计算)天然为这种持续学习提供了丰富的环境与验证机制。
目前 Patel 的观点尚处于理论探讨阶段,但其对 AI 训练范式的反思已引发加密社区对“可进化的智能体”的更多讨论。若实景学习与 OPSD 能够与去中心化验证网络结合,或将催生新一代自主进化链上 AI 系统。

