管理员
发布于 2026-08-09 / 11 阅读
0

个人测试小站 - LingBot-Map 开源项目介绍

所见即所建:LingBot-Map 开源项目介绍

当机器拥有了“空间记忆”

想象一下这样的场景:一个机器人在陌生的大楼里穿梭,它一边移动,一边实时理解周围的环境——哪里是墙壁、哪里是通道、自己走到了什么位置——不需要等待所有数据采集完毕后再进行处理。这种“边看边理解”的能力,正是**流式三维重建**要解决的核心问题。

2026年4月,蚂蚁灵波团队正式开源了 LingBot-Map,一款基于几何上下文Transformer(Geometric Context Transformer)的纯自回归流式3D重建基础模型。它的特别之处在于:仅需一颗普通RGB摄像头,就能在视频采集过程中实时完成相机位姿估计与场景三维结构重建

这意味着,过去需要昂贵传感器阵列或离线后期处理才能完成的工作,现在用一个普通摄像头加一套开源算法就能在线实现。

它解决了什么问题?

传统的三维重建通常走的是“先采集、后处理”的路线——录完视频再跑算法,精度高但无法实时响应。而流式重建要求系统“所见即所建”,这面临着两道坎:

第一,灾难性遗忘。 神经网络在处理新画面时会倾向于覆盖旧信息。视频越长,模型越容易忘记早期建立的几何关系,导致全局漂移。

第二,内存膨胀。 如果想记住所有历史帧,内存会迅速爆炸。万帧以上的长视频,现有流式方法普遍难以稳定应对。

LingBot-Map 的解决方案是引入几何上下文注意力机制(Geometric Context Attention, GCA)。它借鉴了人类选择性记忆的机制,通过三类记忆的分层管理来解决问题:

记忆类型

作用

类比

锚点(Anchor)

记住起点位置

“我从哪来”

位姿参考窗口

记住周围环境

“我身边有什么”

轨迹记忆

记住历史路径

“我走过的路”

这种设计借鉴了经典SLAM系统对空间信息分层管理的思路,但突破了传统方法依赖手工设计和复杂优化的局限,将核心逻辑交由模型统一学习完成。

技术架构速览

LingBot-Map 采用**纯自回归式建模**——不依赖未来帧信息,逐帧处理当前及历史画面,持续输出相机位姿和深度信息。这与大型语言模型处理文本的方式有异曲同工之妙。

其核心技术亮点包括:

  • 分页KV缓存(Paged KV Cache):借鉴自回归大语言模型的KV缓存机制,避免频繁内存重分配

  • 渐进式视图训练:从短子序列开始,训练视图数量从24帧线性递增至320帧

  • 复合损失函数:由深度损失、绝对位姿损失与相对位姿损失共同监督训练

对于超长序列,LingBot-Map 提供了**滑动窗口模式**(Windowed Mode)和**关键帧间隔控制**(Keyframe Interval)等机制,在大幅降低内存占用的同时保持跨窗口的位姿对齐稳定。

开源生态中的位置

自2026年1月以来,蚂蚁灵波已相继开源了高精度空间感知模型 LingBot-Depth、具身大模型 LingBot-VLA、世界模型 LingBot-World 和具身世界模型 LingBot-VA。LingBot-Map 的加入,补齐了**实时空间理解与在线三维建图**的关键能力拼图。

从单帧深度估计,到流式3D重建,再到场景理解和决策控制,一条更完整的具身智能技术链路正在形成。

LingBot-Map 已在 Hugging Face 和 ModelScope 平台同步开源,包含技术报告、核心代码和模型权重。无论你是机器人研究者、自动驾驶开发者,还是对空间智能感兴趣的探索者,这个项目都值得一试。

开源地址

- GitHub: https://github.com/Robbyant/lingbot-map

- Hugging Face: https://huggingface.co/robbyant/lingbot-map

- 魔搭社区: https://www.modelscope.cn/models/Robbyant/lingbot-map

- 技术报告: https://arxiv.org/abs/2604.14141