LingBot-Depth 2.0

1周前发布 290 0 0

蚂蚁集团推出的新一代机器人空间感知模型,可提升三维深度感知能力,增强抓取、导航和环境理解效果。

语言:
zh,en
收录时间:
2026-07-07
LingBot-Depth 2.0LingBot-Depth 2.0

LingBot-Depth 2.0是什么?

LingBot-Depth 2.0 是蚂蚁集团旗下灵波科技(Robbyant)于 2026 年 7 月 7 日发布的新一代机器人空间感知(Spatial Perception)基础模型。它的定位不是大语言模型,而是机器人视觉基础模型(Foundation Model for 3D Vision),主要负责让机器人”看清楚三维世界”。

GPT 是 AI 的大脑,而 LingBot-Depth 是机器人的眼睛。它解决的是机器人最核心的问题之一——空间感知(Depth Perception)

LingBot-Depth 2.0的技术原理

LingBot-Depth 2.0 的突破性进展主要得益于以下两大核心技术:

  • 空间原生视觉基座(LingBot-Vision):它是业内首个将“边界结构”作为预训练目标的视觉基础模型。通过引入几何约束和边界中心掩码建模机制,它拥有亚像素级的边界定位与空间结构理解能力,为深度估计提供了强大的底层支撑。
  • 掩码深度建模(MDM)与海量数据:模型利用深度传感器在透明、反光物体上天然产生的“深度缺失”作为掩码,要求模型仅凭 RGB 彩色图像和剩余有效深度信息去“脑补”完整深度。同时,其训练数据规模从 1.0 版本的 300 万大幅扩充至 1.5 亿,形成了数据与模型的正向循环。

技术优势:

能力 LingBot-Depth 2.0
RGB + Depth 融合
Metric Depth
深度补全 ⭐⭐⭐⭐⭐
透明物体 ⭐⭐⭐⭐⭐
镜面 ⭐⭐⭐⭐⭐
小目标识别 ⭐⭐⭐⭐☆
边缘清晰度 ⭐⭐⭐⭐⭐
机器人抓取 ⭐⭐⭐⭐⭐
三维重建 ⭐⭐⭐⭐⭐
SLAM ⭐⭐⭐⭐☆

LingBot-Depth 2.0的主要功能

  • 复杂材质深度补全:有效攻克了玻璃、镜面、透明物体等传统深度相机容易失灵的“硬场景”,能够输出结构完整、边界清晰的三维深度图。
  • 精细化空间感知:在边缘清晰度、细小物体识别(如电缆、细杆)以及远距离深度估计方面表现优异,避免了机器人因漏检而发生的避障盲区。
  • 高精度与高鲁棒性:在最难的室内大面积深度缺失场景中,深度误差(RMSE)较上一代减半(从 0.132 降至 0.062),并在 16 项深度补全基准测评中拿下 12 项第一。

LingBot-Depth 2.0的使用场景

  • 具身智能与机器人:为机器人的移动导航、避障、精细抓取(如抓取透明收纳箱、玻璃杯、香槟塔)提供可靠的空间数据底座。
  • 工业自动化:赋能精密装配、高反光金属件对齐、物流仓储中的纸箱边界追踪等任务。
  • AR/VR 与自动驾驶:提供精确的深度信息,增强复杂光照和材质环境下的感知安全性与用户体验。

LingBot-Depth 2.0的项目地址

如何使用LingBot-Depth 2.0?

  • 开源获取:LingBot-Vision 的模型权重(提供 ViT-G/L/B/S 四个版本)及技术报告已全面开源,开发者可通过 GitHub、Hugging Face 或 ModelScope 获取。
  • 硬件与 SDK 集成:蚂蚁灵波与奥比中光(Orbbec)达成深度合作。用户可通过奥比中光的 SDK 一键开启空间感知能力,或计划于年底购买集成了该模型商业版的“3D相机+空间感知”一体化相机产品,实现开箱即用。
  • 云端部署:开发者也可以借助百度百舸等 AI 计算平台,使用官方提供的 Docker 镜像快速进行模型运行与推理。

同类产品对比

产品 公司 定位 优势 劣势
LingBot-Depth 2.0 蚂蚁灵波 空间感知 Foundation Model 透明物体、镜面、深度补全能力突出 生态仍在建设
Intel RealSense SDK Intel 深度算法 成熟稳定 玻璃表现一般
Orbbec SDK 奥比中光 相机算法 国产生态 更多依赖硬件
NVIDIA Isaac Perceptor NVIDIA 机器人视觉 与 Isaac 平台集成完善 对 NVIDIA 生态依赖较强
Meta SAM2 Meta 图像分割 分割能力强 不提供真实深度
Depth Anything V2 深度估计 单目深度 无需 Depth 相机 不是真实尺度(Metric Depth)
Metric3D 清华等 单目 Metric Depth 精度较高 对透明物体处理有限
FoundationStereo Meta 等 双目深度 双目估计优秀 对复杂材质仍有挑战

最大的区别在于:

LingBot-Depth 并不是单目深度估计模型,而是面向 RGB-D 相机的”深度补全 + 深度增强”模型,更强调真实尺度和复杂材质场景下的空间感知。

数据统计

相关导航

暂无评论

none
暂无评论...