LingBot-Map 入选 ECCV 2026 Oral,开源社区与学术界同步验证

LingBot-Map 入选 ECCV 2026 Oral,开源社区与学术界同步验证

N
News Editor
2026-09-11 10:13:00
蚂蚁灵波今年 4 月开源的流式 3D 重建模型 LingBot-Map,已在 GitHub 获得 16.9K Stars 和 1.9K Forks,并多次登上 GitHub Trending。其论文《Geometric Context Transformer for Streaming 3D Reconstruction》现已入选 ECCV 2026 Oral。项目围绕机器人如何在长视频中保留空间记忆展开,提出 GCA 几何上下文注意力,在长序列重建、轨迹稳定性、点云质量和运行效率上给出一套新的技术路径。

机器人正在学习一种过去更像人类专属的能力:记住自己走过的空间。

LingBot-Map 入选 ECCV 2026 Oral,开源社区与学术界同步验证 2

人在第一次进入陌生房间时,并不会把眼前画面逐帧存下来。人会记住门的位置、桌子的位置、自己刚刚经过的区域,以及当下身处何处。支撑持续行动的,正是这种带有取舍的空间记忆。对机器人来说,这同样是进入真实世界必须跨过的一道门槛。

蚂蚁灵波今年 4 月开源的流式 3D 重建基础模型 LingBot-Map,正是围绕「机器人如何记住空间」展开。该模型不依赖复杂硬件,只用一颗普通 RGB 摄像头,就能在视频采集过程中实时完成相机位姿估计和场景三维结构重建,试图补上实时空间感知中的关键一环。面对多房间长序列、环境剧烈变化和大幅视角切换,LingBot-Map 仍保持了较强鲁棒性。

截至目前,LingBot-Map 官方 GitHub 项目已获得 16.9K Stars、1.9K Forks,并多次登上 GitHub Trending,已成为 3D 视觉方向关注度较高的开源项目之一。

  • 项目地址:https://github.com/Robbyant/lingbot-map
  • 论文地址:https://arxiv.org/pdf/2604.14141
  • 论文主页:https://technology.robbyant.com/lingbot-map
  • Hugging Face:https://huggingface.co/robbyant/lingbot-map
  • ModelScope:https://www.modelscope.cn/models/Robbyant/lingbot-map

这项研究现在又获得了新的认可。其论文《Geometric Context Transformer for Streaming 3D Reconstruction》已入选 ECCV 2026 Oral,并将在会议期间进行口头报告。机器之心前方编辑还在昨天的 ECCV 开幕式 Award Candidates 名单中看到了这项工作。

从 GitHub 社区的持续关注,到顶级视觉会议的接纳,LingBot-Map 完成了从开发者生态到学术体系的双重验证。它背后映出的变化也很直接:机器人空间感知的竞争点,正从「看见世界」转向「记住世界」。

在 ECCV Oral 之前,项目已先经过开源社区检验

在入选 ECCV Oral 之前,LingBot-Map 已经在开源社区吸引了大量关注。围绕这一项目,开发者进行了多种二次开发:有人快速做了复现验证,有人把它迁移到不同硬件环境中运行,也有人开始尝试新的空间数据采集方式。

这些动作比单纯的 Stars 数量更能说明项目的生命力。它们意味着,项目并不只是被围观,而是已经被拿去实际部署、调试和改造。

从部署到可视化,降低上手门槛

很多研究项目在论文公开后,普通开发者未必就能真正用起来。环境配置、依赖安装、结果展示,往往横在论文 Demo 和真实体验之间。LingBot-Map 开源不久,就有开发者补上了这部分缺口。

有开发者制作了可在 Apple Silicon Mac 上本地运行的原生桌面前端和 3D 点云查看器,方便用户更直观看到模型生成的空间重建结果。

LingBot-Map 入选 ECCV 2026 Oral,开源社区与学术界同步验证 3

来源:https://github.com/donalleniii/lingbot-desktop-mac

与此同时,也有开发者基于 Pinokio 做出了一键启动方案,把环境配置、依赖安装和 Demo 运行流程进一步封装,降低了没有复杂配置经验的用户的使用门槛。

来源:https://github.com/cocktailpeanut/lingbot-map.pinokio

这类尝试补齐了从研究成果到开发体验之间的重要部分,也让更多用户能够真正接触和使用这一流式 3D 重建模型。

适配更多设备,向消费级硬件延展

除了优化使用流程,开发者也开始扩展 LingBot-Map 的硬件适用范围。

开发者 ureeey 针对 RTX 4060 8GB 显存设备进行了适配尝试,通过优化运行策略来降低显存压力,让 LingBot-Map 可以运行在更轻量的 GPU 环境中。

来源:https://github.com/ureeey/lingbot-map-rtx4060-8g/blob/main/README.md?utm_source=chatgpt.com

这类工作背后的意义在于,当模型不再局限于高配置工作站,而是开始进入更常见的开发环境,技术才更有机会被更多人测试、改造和应用。

从摄像头到智能眼镜,社区开始试探新的采集入口

在 X 平台上,有开发者提到,过去一些高精度三维扫描任务通常依赖专业 LiDAR 设备,或者依赖复杂的离线优化流程,传统方法在长时间连续输入下也容易碰到稳定性问题。

LingBot-Map 入选 ECCV 2026 Oral,开源社区与学术界同步验证 4

相比之下,LingBot-Map 通过普通视频流就能完成实时流式重建,只需单 GPU 即可运行,速度约 20 FPS,并能处理超过 10,000 帧的长序列输入。

来源:https://x.com/XAMTO_AI/status/2080900857235726635

在这些开发者看来,这条路线更轻。它降低了对专用硬件和复杂流程的依赖,也让实时三维重建更有机会进入机器人、AR/VR、自动驾驶等场景。

基于这一点,社区中已经有人把 LingBot-Map 接入消费级设备。有人将 Ray-Ban Meta Gen-2 智能眼镜改造成 3D 扫描设备,不使用 LiDAR,通过手机 App 采集数据,再调用部署在 RunPod 上的 LingBot-Map 后端,在约 30 秒内完成所在空间的三维建图。即便只使用较少视频帧,室内场景仍获得了较好的重建结果。

来源:https://x.com/0x6rss/status/2079597540568137866

还有用户在普通戴尔台式机上运行 LingBot-Map,仅对办公桌做一次视频采集,约 61.5 秒后就得到了一个可交互浏览的三维点云模型。

来源:https://x.com/shavonnewong_/status/2080130333094101360

这些案例只是项目开源后社区探索的一部分。对于 3D 视觉研究项目而言,持续出现这种二次开发并不常见,这说明 LingBot-Map 已经开始进入真实使用场景。

开源后,团队也在持续更新评测脚本、推理优化、示例案例和问题修复,继续提升项目可用性与稳定性。与此同时,官方还展示了超长视频重建结果:在约 25,000 帧、持续 13 分钟的室内行走视频中,LingBot-Map 依然能保持连续重建,并生成完整的三维空间表示。

LingBot-Map 入选 ECCV 2026 Oral,开源社区与学术界同步验证 5

社区热度只是一个侧面。对研究成果而言,长期影响力最终还得回到它是否解决了领域里的关键问题。

ECCV Oral 背后,LingBot-Map 重写了什么问题

为什么一个流式 3D 重建模型,既能吸引开发者持续扩展,又能获得 ECCV Oral 的认可?问题要回到机器人空间感知中最核心的一点:面对持续增长的视频输入,机器人如何既保留长期空间记忆,又不让计算和存储成本无限膨胀。

机器人做 3D 重建,不只是看当前画面。它还要同时回答两个问题:现在看到的位置在哪里,过去经过的区域与当前画面之间是什么关系。这意味着模型需要持续估计相机轨迹,生成对应深度信息,并把这些信息组织成不断扩展的三维地图。

与离线重建相比,流式重建天然存在一个矛盾:保留越多历史,空间一致性通常越好;但历史越长,计算和存储成本也会越高。

现有方法大致有三条路线。

  • 一类方法相当于尽量记住全部历史。例如基于 causal attention 的方案,会缓存此前所有帧的信息。上下文是完整的,但随着序列变长,显存和计算量也持续增加。
  • 另一类方法会压缩历史状态,例如循环网络式结构。但如果压缩过度,模型会遗忘关键几何信息,长时间运行后就容易出现轨迹漂移。
  • 还有一类方法会结合传统 SLAM,通过关键帧选择和优化算法维持稳定性。但这类方案依赖人工设计规则,并需要额外优化过程,实时性较难兼顾。

真正难的问题其实很具体:在不断增长的视频流里,哪些空间信息必须留下,哪些可以舍弃?LingBot-Map 将这个问题定义为 streaming reconstruction 中的 context management,也就是上下文管理。它想做的不是记录一切,而是像人的空间记忆一样,只保留最重要的几何线索。

GCA:把空间记忆拆成三层

为了解决这一问题,LingBot-Map 提出了 Geometric Context Attention,也就是 GCA,几何上下文注意力。

它的出发点来自传统 SLAM。一个稳定的空间系统,通常需要三类信息:固定参考点用来确定坐标;附近区域的信息帮助判断当前位置;长距离历史用于防止累计漂移。基于这个思路,GCA 将流式状态拆成三部分。

按照论文描述,LingBot-Map 的框架会处理相对于初始化集 [T, T) 的当前视图。DINO 骨干网络先提取图像特征,再通过交替的帧注意力层和 GCA 层进行细化。在 GCA 模块中,输入视图会聚合来自锚点上下文、局部姿态参考窗口 [T, T] 和轨迹记忆上下文的信息。最后由特定任务头预测相机姿态和深度图,从而实现对长序列的鲁棒、内存高效的流式 3D 重建。

LingBot-Map 入选 ECCV 2026 Oral,开源社区与学术界同步验证 6

第一层是 Anchor Context,用来建立空间坐标。它解决的是「我从哪里出发」这个问题,为整个三维坐标系提供稳定基准。空间重建最怕坐标漂移,有了锚点,模型即便处理到第 10000 帧,也仍能对应回第一帧的位置。

第二层是 Local Pose-Reference Window,用于保持局部精确定位。这一层负责捕捉当前位置附近的局部几何细节,相当于让模型持续知道「我身边有什么」,从而保证逐帧重建的精度。

第三层是 Trajectory Memory,用于压缩长期历史并避免漂移。这也是整套架构里较关键的一环。它把庞大的历史信息压缩成非常紧凑的逐帧 Token,以较低存储代价保留对过去路径的「印象」。借助这一机制,LingBot-Map 的内存消耗几乎不会随视频长度增长。处理 100 帧和处理 10000 帧,总体计算量和内存占用都维持在接近相同的水平。

这种设计带来的效率提升很明显。在 1 万帧序列中,传统 causal attention 大约需要 500 万 token;GCA 只需要约 7 万 token,压缩接近 80 倍。并且每处理一帧新画面,计算量和内存消耗都几乎不会随总帧数增长。

论文还给出了不同注意力机制的对比。每个方框代表一帧的 Token,由一小段上下文 Token 和一段较大的图像 Token 组成。全注意力会关注所有帧;因果注意力支持流式处理,但计算开销随序列长度线性增加;滑动窗口注意力虽然压住了计算成本,却会丢掉长程上下文;GCA 则把流式上下文划分为锚框 n=2、局部窗口 k=2 和轨迹记忆,在保持计算成本近乎恒定的同时,保留更丰富的长程上下文信息。

基准测试:长序列稳定性、轨迹精度和重建质量同时给出结果

实验部分也给出了这一路线的效果。团队首先在 Oxford Spires 数据集上测试,并设置了两种实验条件,分别观察模型的短程定位能力和长程稳定性。

在稀疏设置下,团队选取 320 帧图像,每隔 12 帧采样一次。LingBot-Map 在几乎所有指标上都拿到了最佳结果。

虽然 LingBot-Map 采用的是流式在线推理方式,但其性能仍明显超过最强离线基线方法。AUC@15 达到 61.64,高于最佳离线方法 DA3 的 49.84,也超过 VGGT 的两倍以上,后者为 23.84。在轨迹级精度指标上,LingBot-Map 将 ATE 从 DA3 的 12.87 米、VGGT 的 24.78 米降到 6.42 米。

与依赖跨帧重投影误差优化的传统优化方法相比,LingBot-Map 也取得了更优表现。它超过了表现最好的优化方法 VIPE,在位姿精度和轨迹一致性两个指标上同时占优:AUC@15 为 61.64,对比 VIPE 的 45.35;ATE 为 6.42,对比 VIPE 的 10.52。

LingBot-Map 入选 ECCV 2026 Oral,开源社区与学术界同步验证 7

而在在线流式方法之间的比较中,优势更明显。其他流式方法普遍会出现记忆遗忘,随着序列增长逐渐丢失过去观察到的几何信息,最终引发累计漂移。LingBot-Map 分别达到 61.64 和 6.42,在位姿精度上提升约 10 倍,在轨迹误差上降低约 2.8 倍。

在密集设置下,团队进一步使用完整 3840 帧进行长序列流式重建压力测试。随着轨迹长度从 320 帧增加到 3840 帧,大多数前馈式方法都会因为累计漂移而出现明显性能下降。

LingBot-Map 的误差增长则保持在较低水平,ATE 仅从 6.42 增加到 7.11。在序列长度扩大 12 倍的情况下,误差只增加了 0.69。

这说明 GCA 的三层上下文结构——anchor context、trajectory memory 和 local window——即便不依赖显式优化或回环检测,也能在长距离场景里维持几何一致性。

在保持最高轨迹精度的同时,LingBot-Map 还给出了有竞争力的推理速度,运行速度达到 20.29 FPS,在所有流式方法中实现了最佳轨迹估计效果。

点云重建结果

在高质量三维地图生成方面,团队在 ETH3D、7-Scenes 和 NRGBD 三个数据集上测试点云重建,LingBot-Map 在三个数据集上都取得了最高 F1 分数。

在 ETH3D 数据集上,LingBot-Map 的 F1 为 98.98,比第二名 Wint3R 的 77.28 高出 21.70 个百分点。这意味着它生成的重建结果不仅更准确,对场景结构的覆盖也更完整。

在 7-Scenes 数据集上,LingBot-Map 的 F1 达到 80.39,同时在 Accuracy 0.02 和 Completeness 0.07 两项指标上也都是最佳表现。

在 NRGBD 数据集上,LingBot-Map 的优势更明显,F1 达到 64.26。该数据集包含大量复杂室内环境和精细几何结构。原文指出,在这类场景中,其他方法因为累计位姿漂移,容易出现表面模糊或结构重复,而 LingBot-Map 抗漂移能力更强的轨迹估计可以直接提升重建质量。

LingBot-Map 入选 ECCV 2026 Oral,开源社区与学术界同步验证 8

定性对比结果也反映了这一点。在相对简单的场景中,TTT3R 和 Wint3R 已经出现建筑边缘错位。场景复杂度继续上升后,竞争方法开始出现重复结构和模糊表面,这是累计位姿漂移导致同一几何结构被投影到不同位置的结果。

在最具挑战性的多建筑室外场景中,差距进一步拉大:TTT3R 和 Wint3R 几乎失去空间一致性,生成的点云出现坍缩和碎片化,甚至难以区分独立建筑。相比之下,LingBot-Map 仍保持了清晰几何结构、锐利建筑边缘和连续墙面表面。论文将这一表现归因于 GCA 提供的长期几何一致性能力。

从 LingBot-Map 到一套机器人空间感知体系

从蚂蚁灵波的技术布局来看,LingBot-Map 并不是孤立项目。

对机器人而言,真正的空间理解不是单点能力。它先要看懂眼前环境,再要准确判断距离,最后还要把连续观察整合起来,形成对整体环境的长期记忆。围绕这三个环节,蚂蚁灵波已经布局了 LingBot-Vision、LingBot-Depth 和 LingBot-Map,分别对应视觉结构理解、高精度空间感知和持续空间记忆。

LingBot-Vision 的思路是让模型重新关注图像边界。团队认为,物体轮廓和形状变化区域包含大量几何信息,是机器人理解空间的重要线索。基于这一判断,团队提出了 Masked Boundary Modeling,让模型不需要人工标注或额外边缘检测器,也能自主学习亚像素级边界表示,并用这些边界信息增强视觉表征。

LingBot-Depth 的关键洞见,是把传感器缺失视为可学习信息,而不是纯粹噪声。通过 Masked Depth Modeling,简称 MDM,模型可以结合 RGB 图像中的视觉上下文,推断缺失区域的深度信息。原文提到,这使机器人不仅能看到物体,也能更准确判断物体在三维空间中的位置关系,尤其在处理透明、反光和密集物体时表现更突出。

LingBot-Map 则继续解决「记住」的问题。它通过流式 3D 重建,把连续视频中的视觉信息组织成稳定三维空间表示,让机器人能在持续移动过程中更新环境认知,并保留对已探索区域的记忆。

三者组合起来,形成了一条从感知到理解再到行动的空间智能链路。当机器人可以持续感知、理解并记忆周围环境,才有机会完成更复杂的导航、巡检、操作和任务执行。就本文披露的信息看,LingBot-Map 对应的,正是机器人从看到世界走向理解并利用世界的一步。

本文来自微信公众号「机器之心」(ID:almosthuman2014),编辑:陈陈。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。