网易首页 > 网易号 > 正文 申请入驻

从GitHub爆火到ECCV Oral,全球开发者把LingBot-Map玩出新高度

0
分享至

编辑|陈陈

机器人正在学习一种曾经只属于人类的能力:记住自己走过的世界。

第一次进入陌生房间时,人不会把看到的一切逐帧存储下来。我们会记住关键结构:门在哪里,桌子在哪里,刚才经过的位置,以及自己现在处于什么位置。

正是这种选择性记忆,支撑了人类在复杂环境中的持续行动。对于机器人来说,这也是走向真实世界必须解决的问题。

今年 4 月,蚂蚁灵波开源的流式 3D 重建基础模型 LingBot-Map,正是在「机器人如何记住空间」这一核心问题上,探索出了一条新的技术路线。无需复杂硬件,仅靠一颗普通 RGB 摄像头,就能让机器人在视频采集过程中,实时完成相机位姿估计与场景三维结构重建,从而填补了实时空间感知领域的关键技术空白。



在穿越多房间的长序列中,面对环境剧变与大幅视角变换,LingBot-Map 依然能表现出极强的鲁棒性

截至目前,LingBot-Map 官方 GitHub 项目已获得16.9K Stars、1.9K Forks,并多次登上 GitHub Trending,成为 3D 视觉领域备受关注的开源项目之一。



  • 项目地址:https://github.com/Robbyant/lingbot-map
  • 论文地址:https://arxiv.org/pdf/2604.14141
  • 论文主页:https://technology.robbyant.com/lingbot-map
  • Hugging Face 链接:https://huggingface.co/robbyant/lingbot-map
  • ModelScope 链接:https://www.modelscope.cn/models/Robbyant/lingbot-map

令人惊喜的是,现在这项研究迎来新的认可。

其论文《Geometric Context Transformer for Streaming 3D Reconstruction》入选 ECCV 2026 Oral,将于会议期间进行口头报告。在昨天 ECCV 的开幕式上,机器之心前方编辑还在 Award Candidates 的名单中看到了这项工作。

从 GitHub 社区的高度关注,到顶级视觉会议的认可,LingBot-Map 完成了从开发者生态到学术界的双重验证。

更重要的是,它背后反映出一个变化:机器人空间感知的竞争,正在从看见世界,走向记住世界。

顶会认可之前,LingBot-Map 已完成开源社区验证

在入选 ECCV Oral 之前,LingBot-Map 已经在开源社区收获了一大波关注,开发者围绕这个项目进行了各种二次开发。

有人快速完成复现验证,有人把它搬到不同硬件环境中尝试运行,也有开发者开始探索新的空间数据采集方式。

每个人的玩法都很有趣,这种来自社区的主动探索,往往比单纯的 Stars 数量更能说明它的生命力。

让更多人能够快速体验:从部署到可视化

对于许多研究项目,论文公开并不意味着普通开发者能够真正使用。环境配置、依赖安装、结果展示等环节,往往成为从论文 Demo 到实际体验之间的距离。

LingBot-Map 开源后不久,就有开发者制作了可在 Apple Silicon Mac 上本地运行的原生桌面前端和 3D 点云查看器,让用户能够更加直观地查看模型生成的空间重建结果。



来源:
https://github.com/donalleniii/lingbot-desktop-mac

与此同时,也有开发者基于 Pinokio 制作了一键启动方案,将环境配置、依赖安装以及 Demo 运行流程进一步封装,让没有复杂配置经验的用户也能够快速体验 LingBot-Map。



来源:
https://github.com/cocktailpeanut/lingbot-map.pinokio

这些尝试补齐了从研究成果到开发体验之间的重要环节,让更多用户能够真正接触和使用这一流式 3D 重建模型。

更多设备运行:消费级硬件适配

除了优化使用流程,开发者也开始尝试扩展 LingBot-Map 的硬件适用范围。

开发者 ureeey 针对 RTX 4060 8GB 显存设备进行了适配尝试,通过优化运行策略降低显存压力,让 LingBot-Map 能够运行在更轻量的 GPU 环境中。



来源:
https://github.com/ureeey/lingbot-map-rtx4060-8g/blob/main/README.md?utm_source=chatgpt.com

这类尝试背后的意义在于:当模型不再局限于高配置工作站,而能够进入更多普通开发环境时,技术才有机会被更多人测试、改造和应用。

从摄像头到智能眼镜:探索新的采集入口

在 X 平台上,有开发者关注到,过去部分高精度三维扫描任务通常依赖专业 LiDAR 设备,或者需要复杂的离线优化流程,而传统方法在长时间连续输入下也容易面临稳定性挑战。

相比之下,LingBot-Map 通过普通视频流实现实时流式重建,仅需单 GPU 即可运行,达到约 20 FPS,并能够处理超过 10,000 帧的长序列输入。



来源:https://x.com/XAMTO_AI/status/2080900857235726635

在这些开发者看来,LingBot-Map 展示了一种更加轻量的空间感知路径:降低对专用硬件和复杂流程的依赖,让实时三维重建能力有机会进入机器人、AR/VR、自动驾驶等更多场景。

基于这一点,真有人进一步将 LingBot-Map 接入消费级设备。

他将 Ray-Ban Meta Gen-2 智能眼镜(无需 LiDAR)改造成 3D 扫描设备,通过手机 App 采集数据,并调用部署在 RunPod 上的 LingBot-Map 后端,在约 30 秒内完成所在空间的三维建图。即使使用较少的视频帧,室内场景仍能获得较好的重建效果。



来源:https://x.com/0x6rss/status/2079597540568137866

除了智能眼镜,这位用户在普通戴尔台式机上运行 LingBot-Map,仅对着办公桌进行一次视频采集,约 61.5 秒后便获得了一个可交互浏览的三维点云模型。



来源:https://x.com/shavonnewong_/status/2080130333094101360

而这些,只是 LingBot-Map 开源之后社区探索的一部分。对于一个 3D 视觉研究项目而言,这种持续的二次开发并不常见,这表明 LingBot-Map 已经开始进入真实的使用场景。

开源之后,团队也在持续更新评测脚本、推理优化、示例案例以及问题修复,进一步提升项目的可用性和稳定性。与此同时,官方还展示了超长视频重建结果:在约 25,000 帧、持续 13 分钟的室内行走视频中,LingBot-Map 仍能保持连续重建,生成完整的三维空间表示。

当然,社区热度只是其中一面。对于一项研究成果而言,真正决定其长期影响力的,仍然是它是否解决了领域中的关键问题。

ECCV Oral 背后,LingBot-Map 如何重新设计机器人空间记忆?

那么,LingBot-Map 究竟解决了什么问题?为什么一个流式 3D 重建模型,能够吸引开发者持续扩展,又能够获得 ECCV Oral 的认可?

答案需要回到机器人空间感知中最核心的挑战:如何让机器人在不断增长的视频输入中,既保持对空间的长期记忆,又避免计算和存储成本随着时间无限增加。

对于机器人而言,3D 重建需要边走边理解环境。机器人看到当前画面,需要同时回答现在看到的位置在哪里?过去走过的区域和当前画面之间是什么关系?

这意味着模型需要持续估计摄像头轨迹,并生成对应的深度信息,最终形成不断扩展的三维地图。

流式重建相比离线重建,要面对一个核心矛盾:保留更多历史信息,可以提升空间一致性;但历史越来越长,也会让计算和存储成本快速增长。

现有方法大致采用三种路线。

一种方法类似记住全部历史。例如基于 causal attention 的方案,会缓存之前所有帧的信息。这样模型拥有完整上下文,但随着序列增长,显存和计算量也不断增加。

另一种方法选择压缩历史状态,例如循环网络式结构。但压缩过度可能导致模型遗忘关键几何信息,长时间运行后出现轨迹漂移。

还有一些方法结合传统 SLAM,通过关键帧选择和优化算法维持稳定性。但这类方法依赖人工设计的规则,并且需要额外优化过程,难以兼顾实时性。

因此,真正困难的问题是机器人面对不断增长的视频流,哪些空间信息必须保留,哪些信息可以舍弃?

LingBot-Map 将这个问题称为 streaming reconstruction 中的 context management(上下文管理)。它希望让模型像人类空间记忆一样,只保留最重要的几何线索,而不是记录所有观察。

GCA:把空间记忆拆成三层,让模型知道该记什么

为了解决这个问题,LingBot-Map 提出了Geometric Context Attention(GCA,几何上下文注意力)。

它的核心思想来自传统 SLAM:一个稳定的空间系统,通常需要三类信息:一个固定参考点,用来确定坐标;附近区域的信息,用来判断当前位置;长距离历史,用来避免累计漂移。因此,GCA 将流式状态拆成三个部分。



LingBot-Map 流程。该框架处理相对于初始化集 [T, T) 的当前视图。DINO 骨干网络提取图像特征,然后通过交替的帧注意力层和 GCA 层进行细化。在 GCA 模块中,输入视图聚合来自锚点上下文、局部姿态参考窗口 [T, T] 和轨迹记忆上下文的信息。最后,特定任务的头部预测相机姿态和深度图,从而实现对长序列的鲁棒、内存高效的流式 3D 重建。

第一层:Anchor Context,建立空间坐标。负责记住「我从哪里出发」。它为整个三维坐标系提供稳定基准,空间重建最怕坐标漂移,有了锚点,模型在处理第一万帧时,仍然清楚第一帧发生在什么位置。

第二层:Local Pose-Reference Window,保持局部精确定位。用来负责捕捉当前位置附近的局部几何细节。这相当于对「我身边有什么」保持清醒的即时感知,保证了逐帧重建的精度。

第三层:Trajectory Memory,压缩长期历史避免漂移。这是整个架构中较为关键的设计。它把庞大的历史信息压缩成极其紧凑的逐帧 Token,以较低的存储代价保留对过去路径的「印象」。正是这一机制,让 LingBot-Map 的内存消耗几乎不随视频长度增长,处理 100 帧和处理 10000 帧,总的计算量和内存占用维持在几近相同的水平。

这种设计带来的效率提升相当可观。在 1 万帧序列中,传统 causal attention 需要约 500 万 token;GCA 只需要约 7 万 token,足足压缩了近 80 倍,且每处理一帧新画面,计算量和内存消耗几乎不随总帧数增长。



注意力掩码比较。每个方框代表一帧的 Token,由一小段上下文 Token 和一段较大的图像 Token 组成。(a) 全注意力(Full attention)会关注所有帧。(b) 因果注意力(Causal attention)支持流式处理,但计算开销随序列长度线性增长。(c) 滑动窗口注意力(Sliding-window attention)虽然限制了计算成本,但会丢失长程上下文。(d) GCA 将流式上下文划分为锚框 (n=2)、局部窗口 (k=2) 和轨迹记忆,在保持计算成本随序列长度增加而近乎恒定的同时,保留了丰富的长程上下文信息。

在基准测试上,它表现如何?

实验也验证了 LingBot-Map 有效性。

团队首先在 Oxford Spires 数据集上进行测试,并以两种设置分别测试模型的短程定位能力和长程稳定性。

在稀疏设置中,团队选取 320 帧图像(每隔 12 帧采样)测试,LingBot-Map 在几乎所有指标上都取得了最佳结果。

尽管 LingBot-Map 采用的是流式在线推理方式,但其性能仍大幅超过最强的离线基线方法。具体来看,LingBot-Map 的 AUC@15 达到 61.64,明显高于最佳离线方法 DA3 的 49.84,并超过 VGGT 的两倍以上(VGGT 为 23.84)。在轨迹级别的精度指标上,LingBot-Map 将 ATE 从 DA3 的 12.87 米、VGGT 的 24.78 米降低到了 6.42 米。

相比依赖跨帧重投影误差优化的传统优化方法,LingBot-Map 同样取得了更优表现。它超过了表现最好的优化方法 VIPE,在位姿精度(AUC@15:61.64 vs. 45.35)和轨迹一致性(ATE:6.42 vs. 10.52)两个指标上均取得优势。

而在在线流式方法之间的比较中,优势更加明显。其他流式方法普遍存在严重的记忆遗忘问题:随着序列不断增长,模型会逐渐丢失过去观察到的几何信息,最终导致累计漂移。LingBot-Map 分别达到 61.64 和 6.42,在位姿精度上提升约 10 倍,在轨迹误差上降低约 2.8 倍。



在密集设置(完整 3840 帧)下,团队进一步对模型的长序列流式重建能力进行了压力测试。随着轨迹长度从 320 帧增加到 3840 帧,大多数前馈式方法都会因为累计漂移问题出现明显性能下降。

相比之下,LingBot-Map 始终保持较低的误差水平,ATE 仅从 6.42 增加到 7.11。在序列长度扩大 12 倍的情况下,误差只增加了 0.69。

这说明 GCA 的三层上下文结构 —— 包括 anchor context、trajectory memory 和 local window—— 能够在无需显式优化或回环检测(loop closure)的情况下,有效保持长距离几何一致性。

值得注意的是,LingBot-Map 在保持最高轨迹精度的同时,还达到了具有竞争力的推理速度,运行速度达到 20.29 FPS,在所有流式方法中实现了最佳的轨迹估计效果。



在生成高质量三维地图方面,团队在 ETH3D、7-Scenes、NRGBD 三个数据集测试点云重建。LingBot-Map 均取得最高 F1 分数。



在 ETH3D 数据集上,LingBot-Map 的 F1 达到 98.98,相比第二名 Wint3R 的 77.28 提升了 21.70 个百分点。说明 LingBot-Map 生成的重建结果不仅更加精准,也覆盖了更加完整的场景结构。

在 7-Scenes 数据集上,LingBot-Map 的 F1 达到 80.39,并在 Accuracy(0.02)和 Completeness(0.07)两个指标上均取得最佳表现。

在 NRGBD 数据集上,LingBot-Map 的优势更加明显,其 F1 达到 64.26。NRGBD 包含大量复杂室内环境以及精细几何结构,在这类场景中,其他方法由于累计位姿漂移,容易导致重建结果出现表面模糊或结构重复的问题。而 LingBot-Map具备更强抗漂移能力的轨迹估计,可以直接提升这类场景下的重建质量。

下图是定性对比结果。在较简单的场景中(图中上方几组),TTT3R 和 Wint3R 已经出现建筑边缘错位的问题。随着场景复杂度增加(中间几组),竞争方法开始出现重复结构和模糊表面,这是由于累计位姿漂移导致同一几何结构被投影到了不同位置。

在最具挑战性的多建筑室外场景中(底部几组),差距更加明显:TTT3R 和 Wint3R 几乎完全失去空间一致性,生成的点云出现坍缩和碎片化,甚至无法区分独立建筑。相比之下,LingBot-Map 始终保持清晰的几何结构、锐利的建筑边缘以及连续的墙面表面,说明 GCA 提供的长期几何一致性能力能够直接转化为高质量的 3D 重建效果。


点云重建的定性比较


从一个模型,到一套机器人空间感知体系

其实回看蚂蚁灵波的技术布局,LingBot-Map 并非孤立存在。

对于机器人而言,真正的空间理解并非单一能力。它首先需要看懂眼前的环境,随后需要准确判断距离,最后,还需要把连续观察到的信息整合起来,形成对整个环境的长期记忆。

围绕这三个环节,蚂蚁灵波已经布局了LingBot-Vision、LingBot-Depth 和 LingBot-Map,分别对应视觉结构理解、高精度空间感知以及持续空间记忆。

其中,LingBot-Vision 提出的思路,是让模型重新关注图像中的边界。它认为,物体轮廓和形状变化区域包含大量几何信息,是机器人理解空间的重要线索。基于此,团队提出掩码边界建模(Masked Boundary Modeling),让模型无需人工标注或额外边缘检测器,就能自主学习亚像素级边界表示,并利用这些边界信息增强视觉表征。

LingBot-Depth 的关键洞见是将传感器缺失视为可学习的信息,而非单纯的噪声。通过掩码深度建模(Masked Depth Modeling, MDM),模型能够结合 RGB 图像中的视觉上下文,推断缺失区域的深度信息。这样,机器人不仅能看到物体,还能更准确判断物体在三维空间中的位置关系,尤其在处理透明、反光、密集物体时表现突出。

LingBot-Map 则进一步解决记住的问题,通过流式 3D 重建能力,将连续视频中的视觉信息组织成稳定的三维空间表示,让机器人能够在不断移动过程中更新环境认知,并保持对已经探索区域的记忆。

三者结合起来,形成一条从感知到理解再到行动的空间智能链路。

当机器人能够持续感知、理解并记忆周围环境,它才有可能完成更复杂的导航、巡检、操作和任务执行。LingBot-Map 所推动的,正是机器人从看到世界走向理解并利用世界的关键一步。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
亚运金牌榜之珠穆朗玛脚下的芸芸众生 孟加拉1铜朝鲜历史倒数第三

亚运金牌榜之珠穆朗玛脚下的芸芸众生 孟加拉1铜朝鲜历史倒数第三

劲爆体坛
2026-10-03 17:51:05
看着都是个位数,结账却要93元?!一小吃店小票引热议

看着都是个位数,结账却要93元?!一小吃店小票引热议

濠河神聊
2026-10-03 16:01:49
葡足协欲安排C罗与热苏斯和解!C罗不满:不像阿根廷对梅西那样对我

葡足协欲安排C罗与热苏斯和解!C罗不满:不像阿根廷对梅西那样对我

风过乡
2026-10-03 07:12:24
索尼PSP 3爆料汇总:性能超PS5 能玩PS456三代游戏

索尼PSP 3爆料汇总:性能超PS5 能玩PS456三代游戏

游民星空
2026-10-03 17:08:35
胡适直言:毛泽东不是我学生,他的水平考不上北大!主席从容回应

胡适直言:毛泽东不是我学生,他的水平考不上北大!主席从容回应

小豫讲故事
2026-08-28 06:00:11
颈动脉斑块,不能只靠他汀!做好这 4 点,稳住斑块防脱落

颈动脉斑块,不能只靠他汀!做好这 4 点,稳住斑块防脱落

薛医生课堂
2026-10-03 19:26:31
这次乌龙闹大了!保养忘加机油,新车开1公里爆缸,青岛某知名品牌4S店8.8万回收,引发巨大争议,网友:司机难道没责任吗

这次乌龙闹大了!保养忘加机油,新车开1公里爆缸,青岛某知名品牌4S店8.8万回收,引发巨大争议,网友:司机难道没责任吗

火山詩话
2026-10-02 06:24:45
买 RTX 5090 需实名登记:签“不离美”保证书

买 RTX 5090 需实名登记:签“不离美”保证书

云头条
2026-10-03 11:39:09
聊聊零跑D19太原起火事件:沉默比事故更消耗口碑

聊聊零跑D19太原起火事件:沉默比事故更消耗口碑

玩车专家1
2026-10-03 10:35:47
火箭快捡漏!23年14号秀被裁,顶级射手兑现天赋,鹈鹕仍不给机会

火箭快捡漏!23年14号秀被裁,顶级射手兑现天赋,鹈鹕仍不给机会

你的篮球频道
2026-10-03 10:32:14
亚运会|本届大赛最大冷门出现!地位堪比中国跳水队的韩国射箭队一日连失两金

亚运会|本届大赛最大冷门出现!地位堪比中国跳水队的韩国射箭队一日连失两金

文汇报
2026-10-03 04:04:16
公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

只要高兴就好
2026-09-24 11:58:50
美国华人:中国引以为傲的扫码支付,其实是最不智能的发明?

美国华人:中国引以为傲的扫码支付,其实是最不智能的发明?

史之韵
2026-10-03 19:38:02
微信转账限额规定

微信转账限额规定

匹夫来搞笑
2026-09-30 06:58:09
一根卖15欧元的USB-C线,拆开后里面藏了块能跑视频的屏幕

一根卖15欧元的USB-C线,拆开后里面藏了块能跑视频的屏幕

宅家小欢喜
2026-10-02 20:31:53
张召忠曾预言:如果特朗普再干一届,能把美国拉下马

张召忠曾预言:如果特朗普再干一届,能把美国拉下马

解锁世界风云
2026-10-03 02:24:15
俄苏35战机误袭自家米8直升机!乌克兰摧毁俄铠甲防空系统

俄苏35战机误袭自家米8直升机!乌克兰摧毁俄铠甲防空系统

项鹏飞
2026-10-03 20:14:45
国际油价2日下跌

国际油价2日下跌

证券时报
2026-10-03 07:58:04
梅西改变了足球!德尚:三人协防都难以限制,他迫使对手重新定义足球防守

梅西改变了足球!德尚:三人协防都难以限制,他迫使对手重新定义足球防守

体育闲话说
2026-10-03 12:49:46
救命稻草出现?国民党传来好消息!郑丽文乐了,“内鬼”惨遭打脸

救命稻草出现?国民党传来好消息!郑丽文乐了,“内鬼”惨遭打脸

攒一兜星星
2026-10-03 06:24:13
2026-10-03 21:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14117文章数 142744关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

美国女囚死刑执行到打呼 已成植物人"死不成又活不了"

头条要闻

美国女囚死刑执行到打呼 已成植物人"死不成又活不了"

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

旅游
亲子
家居
公开课
军事航空

旅游要闻

提灯入戏!国庆假期来南京瞻园解锁夜游新玩法

亲子要闻

只要有好奇心的,就不会活的太差

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美国被指正向中东派遣第三艘航母

无障碍浏览 进入关怀版