VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可

VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可

N
News Editor
2026-07-28 10:08:10
自监督学习新工作 VISReg 近日获得图灵奖得主 Yann LeCun 连续转发,并被其概括为从 VICReg 到 SIGReg 再到 VISReg 的技术延续。该方法把表征正则拆分为“尺度”和“形状”两个独立目标,试图解决 JEPA 世界模型中的表征坍塌问题。论文称,VISReg 不依赖 EMA、教师-学生网络、停止梯度冻结层等启发式技巧,在 15 个数据集上综合表现超过 7 种主流方法,并以约 1/10 的训练数据在 OOD 基准上追平 DINOv2。
自监督学习Yann LeCunVISRegJEPA人工智能机器学习表征坍塌

JEPA 世界模型长期面临的“表征坍塌”问题,近日迎来一项新解法。自监督学习新工作 VISReg(Variance-Invariance-Sketching Regularization)获得图灵奖得主 Yann LeCun 连续转发。LeCun 在转发时写道:"VICReg begat SIGReg which begat VISReg",直接点出了这条正则化路线的技术演进关系。

这项工作的切入点,正是 LeCun 自 2017 年起持续倡导的自监督学习(Self-Supervised Learning,SSL)底层难题。SSL 可以在不依赖人工标注的情况下,从大规模数据中学习通用表征,但训练过程中常会出现表征坍塌:模型把不同输入压到相同或极少数几个向量上,表面上训练完成,实际却没有学到可区分的有效表征。

从 VICReg、SIGReg 到 VISReg

为压制坍塌,主流自监督方法往往依赖一组启发式训练技巧,包括 EMA、教师-学生网络、停止梯度、冻结层等。原文指出,这类做法会让训练更脆弱,调参难度更高,也削弱了方法的可解释性和扩展性。

另一条思路是直接用正则项约束表征分布。LeCun 团队此前提出的 VICReg,将目标拆成方差、不变性、协方差三部分,用协方差约束不同维度之间的相关性。但协方差只能描述二阶统计量,无法区分均值和方差相同、但分布形状差异很大的两组表征。

随后提出的 SIGReg 进一步引入 Cramér–Wold 定理,借助 sketching 技术,把整个嵌入分布对齐到标准高斯,以约束完整分布形状。不过论文也指出,SIGReg 仍有两个关键缺陷:一是模型坍塌时梯度会随之衰减,坍塌越严重,修正信号越弱;二是没有把“尺度”和“形状”两个独立属性拆开,导致优化过程中二者相互干扰,在长尾、低质量和低秩数据上的适配性较差。

VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可 3

VISReg 的设计目标,就是在模型最需要梯度信号摆脱坍塌时,仍然保留足够强的恢复能力。

论文链接:https://arxiv.org/abs/2606.02572
代码与预训练权重:https://github.com/HaiyuWu/visreg
项目主页:https://haiyuwu.github.io/visreg/

VISReg 如何处理“尺度”和“形状”

VISReg 结合了 VICReg 和 SIGReg 的优点。它保留了 VICReg 的方差项来控制尺度,同时用基于切片 Wasserstein 距离(Sliced Wasserstein Distance,SWD)的 sketching 目标替代协方差项来控制形状,并通过停止梯度把两部分彻底解耦。完整正则目标由三部分组成。

1. 尺度正则

第一部分用于约束每一维的方差,防止幅值坍塌。论文强调,这一项的关键性质在于,当模型出现坍塌时,它的梯度会趋近于一个常数,而不是像 SIGReg 那样同步衰减。这意味着模型在坍塌状态下仍能收到稳定恢复信号。

2. 形状正则

第二部分先对表征做归一化,去掉尺度影响,再单独约束分布形状。这里的关键是带有停止梯度(stop-gradient,sg)的归一化:对标准差施加停止梯度后,形状损失的优化不会反向改动尺度,从机制上把“尺度”和“形状”两个目标拆开。

VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可 4

在归一化后,VISReg 再通过切片 Wasserstein 距离,把分布几何形状对齐到各向同性高斯。其理论基础来自 Cramér–Wold 定理。论文中的 Lemma 3.1 指出,两个分布相等,当且仅当它们沿单位球面上所有方向的一维投影都相等。也就是说,只要把高维表征沿足够多的随机一维方向切片,并逐一与高斯分布对齐,就等价于在高维空间中对齐整个分布。原文据此强调,这一做法可以用成本较低的一维排序操作来刻画完整分布形状,而不再局限于二阶统计量。

3. 合并目标

第三部分是把 batch 均值拉向原点的中心化损失。三个正则项按权重组合后,再与 JEPA / LeJEPA 延续的不变性预测目标共同构成完整训练目标:不同视角(global + local,共 V 个)的嵌入被拉向全局视角均值,并由单一超参数 λ 在预测项与正则项之间做平衡。

和 VICReg 相比,VISReg 仍保留“解耦”的框架,但不再用协方差来代表形状,而是改用基于切片 Wasserstein 的 sketching 目标来刻画完整分布结构。原文将其概括为:既保留了 VICReg 的灵活性,也获得了分布层面的严格性。

实现轻量,复杂度随扩展因子线性增长

论文称,VISReg 的核心实现非常轻量,正则目标的关键逻辑只需约 15 行 PyTorch 代码。

在计算复杂度方面,VISReg 的正则部分复杂度为 O(NDK),其中 N 为 batch 大小,D 为维度,K 为切片数,对所有扩展因子都是线性增长。作为对比,VICReg 的协方差项复杂度为 O(ND²),会随着维度平方增长。

VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可 5

原文还给出硬件层面的比较:在相同 batch 规模下,VISReg 在单块 H100 GPU 上的运行速度和显存占用都优于 SIGReg。

这套方法还支持切片在多块 GPU 之间分摊。做法是,在 M 块 GPU 上,每块卡各生成 K/M 个切片,最终效果等价于单卡生成全部 K 个切片。实验中,当单卡切片数不足时,改用 8 卡、每卡 128 个切片,总切片数达到 1024,可以把与“单卡 1024 切片”之间的精度差距从约 2.4% 缩小到 0.22%。论文据此认为,在更大规模训练中,K 可以保持常数,单卡负担几乎不会明显增加。

15 个数据集对比结果:VISReg 在 OOD 上最突出

研究团队在 15 个数据集上,将 VISReg 与 7 种主流自监督方法进行对比,覆盖 8 个域内数据集、6 个分布外数据集,以及 ADE20K 稠密预测任务。参与比较的方法包括 MoCoV3、DINO、iBOT、I-JEPA、MAE、data2vec 等,场景涵盖天文、医疗、遥感、纹理、花卉等。

域内线性探测

为了保证可比性,实验按是否使用启发式技巧分为两组。在不使用任何启发式技巧的一组中,VISReg 取得领先。ViT-B/16 的域内线性探测精度达到 75.7%,高于 MAE 的 75.1%;ViT-L/14 进一步提升到 77.0%,高于 LeJEPA 的 75.6%。

VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可 6

与采用启发式技巧的 iBOT 和 DINO 相比,VISReg 在常规数据集上的成绩只略低,但在纹理数据集 DTD 上超过全部方法。原文据此认为,其跨域泛化能力更像来自方法本身,而不是依赖训练技巧堆叠。

分布外泛化

VISReg 最突出的结果出现在 OOD 泛化。研究团队在 6 个与 ImageNet 训练域完全无关的 OOD 数据集上做了评测,覆盖医疗数据集 ChestXRay、RetinaMNIST、OrganAMNIST,天文数据集 Galaxy10,遥感数据集 AID,以及纹理数据集 DTD。

结果显示,VISReg 在所有方法、所有骨干规模上都拿到了最佳平均 OOD 精度,甚至超过部分使用启发式技巧、且骨干更大的方法。按照图 4 所列结果,ViT-B/16 版本的 VISReg 平均 OOD 精度为 70.19%,ViT-L/14 为 70.63%,高于 MAE 的 67.85%,也高于 MoCoV3 的 69.46%、DINO 的 69.56%、I-JEPA 的 68.55%。

数据效率

在数据效率测试中,论文把 VISReg(ViT-L/14)放到 ImageNet-22K 上进行预训练。ImageNet-22K 约包含 1400 万张图像。训练完成后,VISReg 在 6 个 OOD 数据集上的平均精度达到 72.94%。

作为对照,在 10 倍规模数据 LVD-142M(1.42 亿张图像)上训练的 DINOv2,平均 OOD 精度为 72.93%。也就是说,VISReg 用约 1/10 的数据,达到了与 DINOv2 基本持平的 OOD 水平。原文同时给出另一个对照值:同样是 ViT-L/14,但只用 ImageNet-1K 预训练的 VISReg,平均精度为 70.63%。

迁移微调

虽然 VISReg 在部分域内数据集上的线性探测精度略低于 DINO,但在微调后,结果出现反转。论文称,VISReg 在 CIFAR-10、CIFAR-100、Flowers、ImageNet-1K、Galaxy10 五个数据集上,全部超过 DINO 和有监督预训练。

原文认为,这反映出 VISReg 学到的表征分布更均匀、冗余更低,因此迁移性更强。不过这一判断来自论文与原报道表述,而不是额外推断。

稠密预测与生成引导

VISReg 的表现不只停留在分类任务。在 ADE20K 线性语义分割任务上,ViT-B/16 版本的 VISReg mIoU 为 30.16,高于 DINO 的 29.40 和 MAE 的 23.60,仅低于 MoCoV3 的 31.69。原文同时指出,这一结果是在不使用任何启发式技巧的前提下取得的,但论文也承认,VISReg 在稠密预测上和最优方法之间仍有差距,后续仍需继续优化。

在生成引导实验中,研究使用 SiT-B/2 和 iREPA 框架,训练 10 万步。由 VISReg 特征引导的生成,在 4 项指标中的 3 项优于 DINO:gFID 为 40.36,DINO 为 41.15;Precision 为 51.38,DINO 为 50.51;Recall 为 61.26,DINO 为 60.70;IS 基本持平,为 33.48 对 33.47。

低质量数据鲁棒性

论文还测试了 VISReg 在低质量数据上的稳定性,包括长尾分布数据集 ImageNet-LT 和低秩数据集 Galaxy10。原文称,VISReg 在这些场景中能够稳定防止坍塌,并学到有意义的表征;而 DINO 在缺乏精细调参时会直接失败。

VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可 8

指向 JEPA 世界模型的一条新正则化路线

从论文和原文给出的结果看,VISReg 的核心贡献不只是分数提升,而是提出了一种新的正则化拆分方式:把表征约束明确拆成“尺度”和“形状”两个独立组件。

原文结论认为,这样的解耦让自监督学习在稳定性、效率和泛化上都优于现有方法。在不依赖训练启发式技巧的前提下,VISReg 在图像识别、分割和生成引导等任务上取得了领先或接近领先的表现,并以约 1/10 的数据达到了 DINOv2 的 OOD 水平。这也为 JEPA 世界模型长期存在的表征坍塌问题提供了一种新的正则化方案。

参考资料:https://arxiv.org/abs/2606.02572

本文来自微信公众号“新智元”,作者:LRST。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。