高德发布首个无长程依赖万帧级流式 3D 重建模型 ABot-Recon,仅凭 12 帧实现实时重建
8 月 28 日,阿里巴巴集团旗下高德正式发布首个无长程依赖的万帧级流式 3D 重建模型——ABot-Recon。该模型无需长程记忆,仅凭连续 12 帧的局部画面,即可实时稳定地重建上万帧的 3D 场景,实现“边拍边建”。在 KITTI、Oxford Spires、VBR 等权威评测中,ABot-Recon 均取得了最低误差的 SOTA(行业最高水平)表现。

随着自动驾驶、具身智能等技术逐步走向开放环境,物理 AI 需要的不再只是“看见”,而是在移动中持续理解空间:明确自身定位、感知周围环境并规划下一步路径。尤其在定位信号弱、环境变化快的商场、园区、仓库等私域场景中,系统难以依赖一次性建图或事后重建。
目前,主流的解决方案是通过流式 3D 重建技术实现三维场景的实时重建,但该技术往往受制于误差累积和显存占用过大等问题。为了保持长距离场景的全局一致性,传统的流式 3D 重建通常会在重建过程中设置记忆锚点,依赖长程记忆不断保存、检索和融合历史信息。然而,随着序列变长,模型的运行速度会变慢、精度会下降,显存占用也会急剧升高。
为此,ABot-Recon 采用了一条全新的技术路径——“局部位姿预测+残差优化”,以应对长序列对精度、速度和显存带来的多重挑战。与同类方法不同,ABot-Recon 摒弃了采用长程记忆锚点进行记忆对齐的传统方式。该模型仅以最近的 12 帧连续画面作为局部上下文窗口,每次只预测当前相机坐标系下的局部点云以及相邻两帧之间的相对位姿,使计算复杂度保持恒定,并确保了轨迹的平滑度;随后,通过在线组合逐步拼接出完整的全局轨迹与三维场景。由于预测目标始终保持局部性且与序列长度无关,模型的内存占用与单帧计算量不会随着视频长度的增加而膨胀。

针对局部预测中常见的误差累积问题,ABot-Recon 在预测端和训练端分别设计了纠偏与误差约束机制,能够实时校准轨迹误差。凭借这一开创性的模型设计,ABot-Recon 在多个公开的长序列基准测试中超越了现有方法:
- 在精度上:在 Oxford Spires 长序列基准测试中,ABot-Recon 的平均轨迹误差较行业代表性方法 LingBot-Map 降低了 40.6%;相对旋转误差(RPE-R)低至 0.12°,为同类流式方法中的最优表现,较前代 SOTA 降低了约 40%。
- 在速度上:在 KITTI-02 测试中,ABot-Recon 实现了 24.45 FPS 的实时重建,推理速度达到行业代表性方法的 1.24 倍。在平均轨迹误差低于 20 米的所有方法中,ABot-Recon 实现了最高的吞吐量和最低的显存占用。
- 在显存方面:ABot-Recon 的峰值显存占用仅约 6.71 GB,约为同类模型的三分之一。这意味着仅需一张消费级显卡(如 GTX 1080 Ti)即可流畅运行,大幅降低了流式 3D 重建技术的使用门槛。
值得一提的是,ABot-Recon 仅需单目 RGB 视频输入,无需额外的深度传感器或已知的相机内参,即可实现万帧级的实时三维重建。这使得它不仅能服务于测绘行业的私域建图与底图更新,还能广泛应用于具身智能、自动驾驶和 3D 内容生产等多元场景。

这些突破共同印证了一个看似反直觉的结论:要让模型“走得更远”,并不一定需要它“记得更多”。仅关注 12 帧的轻量化模型,反而走出了一条更准、更快、更省的全新路径。目前,ABot-Recon 已在 GitHub 开源了推理及评测代码与权重,并在魔搭社区上线了体验专区,方便开发者直接上手体验。
相关链接: