英伟达Lyra 2.0开源:单图生成3D世界,破解空间失忆与时序漂移

英伟达Lyra 2.0开源:单图生成3D世界,破解空间失忆与时序漂移

N
News Editor 01
2026-07-22 15:25:13
英伟达发布Lyra 2.0框架,单张图片即可生成可探索3D世界。通过几何索引记忆与自增强训练,破解长程生成中的空间失忆和时序漂移。输出3D高斯泼溅或网格,支持导入Isaac Sim机器人训练。
英伟达AI3D世界生成机器人训练开源

NVIDIA Spatial Intelligence Lab 今日发布开源 Lyra 2.0 框架。从单张图片出发,沿用户自定义的镜头轨迹,持续生成可探索的大型 3D 世界。最终输出为 3D Gaussian Splatting(3DGS)或三角网格,可直接导入 Isaac Sim 用于机器人训练。

长程生成的两大死穴

现有视频生成模型只能输出视觉精致的短片段。一旦镜头拉远,试图"绕整栋楼走一圈",品质便急速衰减。NVIDIA 团队将其归因于两种机制:空间失忆(spatial forgetting)与时序漂移(temporal drifting)。前者指模型上下文窗口有限,远处区域在记忆中滑落,回头时只能凭空幻想;后者指自回归生成中细微误差逐帧叠加,几十帧后色调与材质面目全非。两者叠加,使"先生成视频、再重建 3D"的路径在长程场景近乎失效。

Lyra 2.0 的两支解法

针对空间失忆,Lyra 2.0 引入空间记忆机制:系统对每一帧维护逐帧 3D 几何信息。新目标视角出现时,从历史帧中检索重叠度最高的帧,将其正则座标投影对齐,建立稠密 3D 对应,通过注意力机制注入 DiT。几何信息仅用来"定位",外观合成由生成先验处理,既保视觉丰富度,又避免产生新结构。

针对时序漂移,Lyra 2.0 采用自增强训练(self-augmented training):训练时故意喂入模型自己生成的带噪历史帧,强迫模型学会"看到漂移就修正",而非"跟着漂移继续走"。这类似于让学生批改自己的考卷——只有亲见错误,才能形成纠错反射。

交互式探索与 3D 导出

Lyra 2.0 配备交互式 GUI,用户可实时检视累积点云,手动规划下一段镜头轨迹:重返已探索区域或朝未知方向推进。场景生成采用渐进式架构:用户走到哪,模型生成到哪,无需预先指定完整路径。生成完成后,视频帧通过前馈重建模型转换为 3D Gaussian Splatting 或三角网格,两种格式均可直接导入物理引擎。NVIDIA 特别演示了输出至 Isaac Sim���供机器人执行有物理基础的导航与互动任务。

论文编号 arXiv:2604.13036,代码以 Apache 2.0 开源在 GitHub;模型权重发布于 HuggingFace(nvidia/Lyra-2.0)。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。