返回AI训练范式

AI训练范式

AI训练范式
2026-06-29 00:01:37

Dwarkesh Patel:下一代AI训练应走向真实世界持续学习,OPSD与Dreaming成关键路径

AI研究者Dwarkesh Patel提出,超越当前可验证奖励强化学习(RLVR)的下一代AI训练范式,应转向在真实世界任务中持续学习并将经验沉淀回模型权重。他强调“可磨性”、on-policy self-distillation(OPSD)和“dreaming”模拟训练等技术路径,推动AI从发布前训练转向发布后持续进化。这一理念对去中心化AI算力网络、链上智能代理等Web3场景具有潜在影响。

450
Dwarkesh Patel:下一代AI训练应走向真实世界持续学习,OPSD与Dreaming成关键路径