NVIDIA Spatial Intelligence Lab 今日发布开源 Lyra 2.0 框架。从单张图片出发,沿用户自定义的镜头轨迹,持续生成可探索的大型 3D 世界。最终输出为 3D Gaussian Splatting(3DGS)或三角网格,可直接导入 Isaac Sim 用于机器人训练。
长程生成的两大死穴
现有视频生成模型只能输出视觉精致的短片段。一旦镜头拉远,试图"绕整栋楼走一圈",品质便急速衰减。NVIDIA 团队将其归因于两种机制:空间失忆(spatial forgetting)与时序漂移(temporal drifting)。前者指模型上下文窗口有限,远处区域在记忆中滑落,回头时只能凭空幻想;后者指自回归生成中细微误差逐帧叠加,几十帧后色调与材质面目全非。两者叠加,使"先生成视频、再重建 3D"的路径在长程场景近乎失效。
Lyra 2.0 的两支解法
针对空间失忆,Lyra 2.0 引入空间记忆机制:系统对每一帧维护逐帧 3D 几何信息。新目标视角出现时,从历史帧中检索重叠度最高的帧,将其正则座标投影对齐,建立稠密 3D 对应,通过注意力机制注入 DiT。几何信息仅用来"定位",外观合成由生成先验处理,既保视觉丰富度,又避免产生新结构。
针对时序漂移,Lyra 2.0 采用自增强训练(self-augmented training):训练时故意喂入模型自己生成的带噪历史帧,强迫模型学会"看到漂移就修正",而非"跟着漂移继续走"。这类似于让学生批改自己的考卷——只有亲见错误,才能形成纠错反射。
交互式探索与 3D 导出
Lyra 2.0 配备交互式 GUI,用户可实时检视累积点云,手动规划下一段镜头轨迹:重返已探索区域或朝未知方向推进。场景生成采用渐进式架构:用户走到哪,模型生成到哪,无需预先指定完整路径。生成完成后,视频帧通过前馈重建模型转换为 3D Gaussian Splatting 或三角网格,两种格式均可直接导入物理引擎。NVIDIA 特别演示了输出至 Isaac Sim���供机器人执行有物理基础的导航与互动任务。
论文编号 arXiv:2604.13036,代码以 Apache 2.0 开源在 GitHub;模型权重发布于 HuggingFace(nvidia/Lyra-2.0)。

