视觉同步定位建图进展

wen IT资讯 2

本文目录导读:

视觉同步定位建图进展

  1. 神经隐式SLAM与3D高斯溅射(3DGS)的颠覆性融合
  2. 基于大规模预训练模型的语义SLAM与主动探索
  3. 端到端学习与图优化(GNN)的深度耦合
  4. 多传感器融合:视觉-惯性-雷达的“黄金三角”
  5. 鲁棒性与挑战性场景的专项突破(“破坏性”场景)
  6. 长期自动驾驶规模化的“车道级”SLAM
  7. 关键技术趋势总结
  8. 未来1-2年值得关注的方向(展望)

视觉同步定位与建图(Visual SLAM,vSLAM)是计算机视觉与机器人领域的核心技术,近年来,随着深度学习、神经渲染和传感器硬件的突破,该领域正经历从几何驱动学习驱动+多模态融合的范式转移。

截至2025年年中,视觉SLAM的最新进展主要集中在以下几个维度:

神经隐式SLAM与3D高斯溅射(3DGS)的颠覆性融合

这是目前最火热的方向,标志着SLAM从稀疏/半稠密地图迈入高保真辐射场地图时代。

  • 3D GS-SLAM(如SplaTAM、GS-SLAM、MonoGS):在2024-2025年集中爆发,它们将3D高斯椭球作为地图表示,取代了传统的体素或神经辐射场(NeRF)。
    • 核心优势:相比NeRF-SLAM,3DGS能做到实时(>30 FPS)的渲染和优化,且内存管理更优。
    • 进展:最新研究解决了尺度漂移(单目)和动态物体遮挡问题,并引入了增量式致密化策略,使得在大规模场景中建图更稳定。
  • 物理一致性增强:近期工作(如Physics-GS)开始引入接触力表面材质估计,让重建出的地图不仅能看(视觉)还能摸(力觉反馈),为具身智能(Embodied AI)做准备。

基于大规模预训练模型的语义SLAM与主动探索

传统SLAM只回答“我在哪”,现在的SLAM开始回答“这是什么”和“我该去哪”。

  • 多模态大语言模型(MLLM)驱动:视觉语言SLAM(如VLMaps、GOAT)将预训练的CLIP或视觉大语言模型特征融入地图,机器人可以通过自然语言指令(如“去蓝色的椅子旁”)直接在地图中进行语义导航。
  • 零样本泛化:新架构利用开放词汇表(如Open-vocabulary),无需额外训练即可识别训练集中未出现的新物体,大幅提升了SLAM在陌生环境中的实用性。

端到端学习与图优化(GNN)的深度耦合

虽然传统SLAM前端特征点+后端优化依然稳健,但“学习型组件”正在不可逆转地渗透:

  • 学习型特征描述子:超点(SuperPoint)、轻量级特征算子(D-Light)等被全面替代非学习型特征,尤其在纹理稀疏和剧烈光照变化场景下鲁棒性成倍提升。
  • 基于图神经网络(GNN)的回环检测:图匹配在拓扑结构上比词袋(BoW)更精确,近期研究将回环检测转化为图同构问题,配合全局描述子(如NetVLAD的Transformer变体),在恶劣天气下的环境一致性显著增强。
  • 可微分SLAM:将整个SLAM过程(前端特征提取到后端BA)构建为可微计算图,通过自监督学习直接优化位姿和深度,减少了对真值标注的依赖。

多传感器融合:视觉-惯性-雷达的“黄金三角”

纯视觉在退化环境(弱光、白墙、旋转过快)下依然吃力,因此紧耦合多模态成为工业级落地标配:

  • VIO+3DGS:将视觉惯性里程计(VIO)的快速位姿初始化与3DGS的稠密重建结合,解决了单目3DGS-SLAM初始化慢、易炸的问题。
  • 雷达-视觉-惯性(LVI-SLAM):4D毫米波雷达与固态激光雷达的引入,解决视觉传感器受光照影响的问题,近期重点在于异质特征同步,即如何在拓扑结构上对齐点云稀疏的雷达特征与密集的视觉特征。

鲁棒性与挑战性场景的专项突破(“破坏性”场景)

  • 极端动态环境:基于残差流形隐式分割(利用无监督视频分割)的方法,将地图中的静态背景与动态物体(行人、车辆)分离,最新的趋势是动态物体也参与建图(“动态SLAM”转变为“动态场景理解”)。
  • 低光照与SLAM:结合事件相机(Event Camera)与帧相机,事件相机的高动态范围(HDR)能力使SLAM在亮度跳跃(如隧道出口)时不再失效,这是自动驾驶领域的重要推进方向。

长期自动驾驶规模化的“车道级”SLAM

  • 地磁+视觉融合:在车载场景中,最新的视觉SLAM开始融入车道线几何约束高精地图图元的先验,实现“无GPS”下的厘米级重定位。
  • 众包更新机制:大厂的重心转向云端SLAM,车辆采集数据上传后,云端负责全局优化,向终端下发增量更新包,降低车端算力压力。

关键技术趋势总结

维度 传统方法特征 当前最新特征
地图表示 稀疏特征点 / 稠密体素 3D高斯溅射(3DGS)、NeRf辐射场
回路检测 视觉词袋(BoW) 图匹配(GNN)+ 语义/几何联合嵌入
鲁棒性 依赖高梯度纹理 多模态融合(VIO+Lidar),事件相机
智能关联 纯几何(点、线、面) LLM语义+开放词汇表
输出产物 几何坐标+姿态 可交互的语义+物理地图(交互式辐射场)

未来1-2年值得关注的方向(展望)

  1. 4D一致性:不只重建静态世界,而是处理“流场”中的动态物体(如缠着绷带的行人),并保持时间一致性。
  2. 端侧轻量化:将3DGS的渲染与优化压缩到10MB以内的轻量模型,部署在机器人或手机端(当前3DGS内存占用依然很大)。
  3. 视觉-触觉-听觉联合感知:对于服务机器人,视觉SLAM将产生多模态锚点,将视觉信息与音频(如“这里是厨房的切菜声”)结合,拓展感知边界。
  4. 主动探索式SLAM:将“好奇度”作为奖励函数输入SLAM,让机器人自动决定探索哪些未观测区域以最大化地图信息增益。

视觉SLAM的进展已不再是单纯的“定位精度竞争”,而是“场景理解能力”的竞争,它正在从“使机器能走路”的定位工具,进化为“使机器能思考”的空间记忆中枢,对于开发者而言,目前落地门槛最高但效果最惊艳的无疑是3D高斯溅射与语义特征的混合架构

抱歉,评论功能暂时关闭!