来源:市场资讯
(来源:科技行者)
![]()
这项由丹麦技术大学电气与光子工程系及先锋人工智能中心联合主导、并与建筑企业Christiansen & Essenbaek A/S合作完成的研究,于2026年6月发布在arXiv预印本平台,论文编号为arXiv:2606.23152。研究得到欧盟地平线欧洲项目"RoBétArmé"(批准协议号101058731)的资金支持。有兴趣深入阅读原文的读者可通过该编号在arXiv上查阅完整论文。
在地下隧道或矿井里,工人们正在用一根粗大的软管向岩石或混凝土墙壁喷射快速凝固的混凝土,这种工艺叫做"喷射混凝土"(shotcrete)。这是一种加固不稳定地下结构、修复损坏建筑或构建复杂几何形状的关键施工手段。然而,喷射过程中大量混凝土颗粒会弹射反弹并悬浮在空气中,整个封闭空间瞬间变成一片灰白色的浓雾,能见度急剧下降,人待在里面需要全副武装的防护设备。
如果我们希望用机器人代替人类完成这项又脏又危险的工作,首先要解决的就是让机器人"看清楚"自己在哪里、前方有什么、墙壁距离多远——也就是说,机器人需要一双能在粉尘漫天的环境中可靠工作的"眼睛"。这项研究的核心贡献正在于此:研究团队实地采集并发布了一个名为**ShotcreteDepth**的双模态数据集,同时配套发布了一个轻量级标注工具,为未来开发能在这种极端环境中正常工作的机器视觉系统提供了至今为止第一份公开可用的基础资料。
一、为什么喷射混凝土环境对机器人的"眼睛"来说是一场噩梦
要理解这份数据集的价值,首先得感受一下喷射混凝土现场究竟有多恶劣。把它与我们日常生活做个对比:你在厨房炒辣椒时,油烟和辣椒粉呛得人睁不开眼,拍出来的手机照片也是模糊一片。喷射混凝土现场的情况比这严重许多倍——混凝土颗粒密集地悬浮在完全封闭的地下空间里,照明只有人工灯光,有些地方过亮,有些地方则漆黑一片。
机器人常用的两种"眼睛"在这种环境下都会出问题。一种是立体摄像头,它的工作原理就像人的两只眼睛一起看,通过左右两张图片的细微差异来判断距离——就好像你用左手遮住左眼再遮住右眼,近处的物体"位置"会明显跳动,远处的则几乎不变,这个"跳动量"就是判断距离的关键。但当空气中充满粉尘、画面变得模糊时,两张图片里的"特征点"很难对应起来,测距就变得不准确。
另一种是激光雷达(LiDAR),它通过发射激光束并测量反射回来的时间来计算距离,就像蝙蝠的回声定位。然而,密集的混凝土颗粒会把激光束散射掉,导致三种糟糕的后果:激光被颗粒"吸收"或偏转,根本没有信号返回,造成大量数据缺失;返回的信号变得杂乱无章,整体数据质量下降;更诡异的是,悬浮在空中的混凝土粉尘云团会被激光雷达"看见"并记录为实体障碍物,但摄像头和人眼几乎看不到它——就好像激光雷达在空气中"幻视"出了一堵并不存在的墙。研究团队还测试了一款固态激光雷达,结果发现它在粉尘环境中完全失灵,一个距离数据都测不出来,研究团队推测这可能与该设备使用的1550纳米波长激光及其内部信号处理方式有关。
正因如此,开发喷射混凝土机器人的感知系统,比开发普通室外自动驾驶或仓库机器人的感知系统要难得多。而在这份数据集发布之前,整个领域连一份公开的相关数据都没有。
二、数据集是怎么采集的,以及这套"眼睛"长什么样
研究团队把两种传感器装进了一个特别定制的防尘外壳里——这个外壳是用3D打印技术制造的,专门为防止混凝土颗粒侵入传感器而设计。
立体摄像头是Roboception rc visard 160c彩色版本,配备4毫米焦距镜头。它能同时拍摄左右两张高分辨率彩色图片,分辨率为1280×960像素。同时,摄像头内部集成了一块英伟达Tegra K1计算芯片,能直接在相机本体上运行"半全局匹配"算法(一种经典的立体视觉算法),实时计算出分辨率为640×480的视差图(视差图可以理解为一张"距离热力图",颜色深浅代表不同距离)和置信度图(表示每个距离测量值的可靠程度)。摄像头的水平视角为61度,垂直视角为48度。
激光雷达是Velodyne PUCK型号,俗称"曲棍球",因为它的外形确实很像一个扁圆形曲棍球。它有16条扫描线,垂直视角30度,测距范围最远100米,精度通常在正负3厘米以内,工作波长为903纳米。它被安装在摄像头正上方,同样固定在防尘外壳内。激光雷达投影到图像平面后的深度图分辨率同样为1280×960。
两个传感器的采集频率不同:彩色图片每秒25帧,立体视差图每秒3帧,激光雷达点云每秒10帧。为了让不同频率的数据能够配对使用,团队采用了精确的时间同步方案——激光雷达通过GPS模块接收PPS脉冲信号和NMEA消息来精确打时间戳,摄像头则通过PTP网络时间同步协议与同样连接GPS的采集电脑同步。最终,每一帧彩色图片和视差图都与时间上最接近的那一帧激光雷达点云配对,组成一个完整的数据样本。
三、这份数据集里有什么
整份ShotcreteDepth数据集共包含11,252个完整的时间同步数据样本,记录了喷射混凝土施工前、施工中、施工后以及一般建筑工地的各种场景。为了能够用这份数据评估算法性能,研究团队从中挑选了220个样本进行人工标注。挑选时特意跳过相邻的高度相似帧,确保这220个样本尽可能涵盖多样化的场景,而不是集中在某一类似情况。
每个完整数据样本包含:左摄像头彩色图、右摄像头彩色图、视差图、置信度图,以及对应的激光雷达点云投影深度图。从论文的示例图中可以看到,视差图用暖色(红橙黄)表示近处、冷色(蓝色)表示远处;置信度图则展示了哪些区域的视差测量值是可靠的(颜色鲜艳区域),哪些是不可靠的(黑色区域,大多出现在无纹理表面或粉尘遮挡处);激光雷达投影图则呈现为稀疏的横条纹图案,因为16条扫描线投影后在垂直方向上分辨率极低。
四、专门为处理激光雷达"幻视"而开发的标注工具
前面提到,激光雷达会把空气中的粉尘云"看见"并当成实体记录下来。如果直接用这些被污染的激光雷达数据作为算法评估的"标准答案",等于让算法去学习一个错误的参照物。这就像考试时发现标准答案本身有错误,再认真的学生也会被带偏。
为此,研究团队专门开发了一个轻量级的点云标注工具,并作为开源代码随数据集一起发布。这个工具的界面分为上下两个视图:上方是激光雷达点云的三维立体视图,可以自由旋转查看;下方是把点云投影叠加到左摄像头彩色图上的二维视图,帮助标注人员对照真实场景判断哪些点是空气中的粉尘,哪些是真实的墙壁或物体表面。操作者可以通过键盘快捷键在"旋转模式"和"标注模式"之间切换,并将点标记为"由用户保留"或"由用户移除"。工具还支持"由算法保留"和"由算法移除"两种标签,用于记录程序自动处理的结果。
除了手动标注粉尘点,数据集还对激光雷达常见的另一种噪声——遮挡点——进行了自动过滤。遮挡点是指当多个传感器从不同角度观测同一场景时,某些在激光雷达视角下可见但在摄像头视角下被遮挡的点。处理方法是使用一个滑动窗口在投影到图像平面的深度点上移动,窗口大小设为10×50像素,把窗口内距离超过最近点0.5米以上的点标记为"由算法移除"。值得注意的是,被用户手动标记为移除的粉尘点会在这一步被跳过,避免误删粉尘点周围的真实表面点。
五、用九种算法来"考一考"这份数据集
数据集发布的同时,研究团队还用它测试了九种当前最先进的深度感知算法,分属三大类:立体匹配、深度补全和深度估计。这就像为一份新出的考卷同时邀请多位学生作答,既检验了这份考卷的区分度,也为后来者提供了基准成绩。
所有算法的推理均在640×480分辨率下运行,结果上采样后在1280×960分辨率下计算评估指标。激光雷达点云经过标注和过滤后作为评估的"标准答案"。
**立体匹配**这一类算法的任务是根据左右两张图片计算每个像素对应的距离。评估指标包括:端点误差(EPE,单位像素,数值越小越好)、D1(误差超过3像素且超过真实值5%的点的比例,越小越好)、平均绝对误差(MAE,单位米)、均方根误差(RMSE,单位米),以及算法能覆盖多少比例的图像区域(Coverage)。
研究团队测试了四种方案。相机内置的半全局匹配算法直接运行在相机的嵌入式芯片上,算法经过了高度优化,每秒能处理约3帧,但它只能覆盖61%的图像区域——也就是说将近四成的像素它算不出距离来,在粉尘遮挡或光照不均匀的区域尤其糟糕。它的EPE为2.276像素,D1为0.106,但MAE高达1.467米、RMSE高达2.207米,说明虽然整体像素级误差不大,但一旦出错就错得很离谱。
RAFT-Stereo是一种基于循环迭代优化的神经网络方法,参数量约1100万,单帧推理时间约0.141秒。它能覆盖100%的图像区域,EPE为2.449像素,D1为0.130,MAE为0.337米,RMSE为0.729米。FoundationStereo是一个基于大型Vision Transformer骨干网络的重量级模型,参数量达3.75亿,推理时间约0.156秒,EPE为2.439,D1为0.129,MAE为0.327米,RMSE为0.741米。StereoAnywhere同样是大型模型,参数量3.47亿,推理时间约0.307秒,它在EPE(2.328)和D1(0.103)两项核心立体匹配指标上表现最好,MAE为0.311米,RMSE为0.795米。
从这组数字可以读出一个有趣的现象:相机内置算法在像素级别的视差精度(EPE、D1)上并不输给神经网络,甚至略有优势,但它的深度误差(MAE、RMSE,单位米)极大,原因在于它有大量区域完全无法计算,这些区域被排除在EPE和D1统计之外,但MAE和RMSE是按实际覆盖点计算的,当错的地方错得很严重时,整体误差自然飙升。神经网络方法虽然在逐像素精度上略逊,但能做到全图覆盖,且整体深度误差更小,在这种粉尘弥漫、遮挡严重的环境下更可靠。定性上,神经网络也能在极暗或过曝的区域生成更清晰的物体轮廓。
**深度补全**这一类算法的任务是:给你一张彩色图,再给你从立体匹配算出的500个稀疏的已知距离点,让你把整张图的距离都填充完整。可以理解为,拥有一张城市地图(彩色图)和500个已知海拔的采样点(稀疏深度),要你画出完整的地形等高线图。稀疏的500个深度点来自StereoAnywhere的输出,选它的原因是它的EPE和D1最低、输出最干净。
评估指标包括MAE、RMSE(单位均为米),以及边界准确度指标:伪深度边界误差的准确性(E_PDBE_acc,越小越好)和完整性(E_PDBE_comp,越小越好),边界真值来自StereoAnywhere的输出。
Marigold-DC是基于扩散模型(一种类似"从噪声中逐步还原图像"的生成式方法)的深度补全算法,参数量约9.5亿。单次运行MAE为0.364米、RMSE为0.893米,但将10次独立运行的结果取平均(集成)后,MAE降至0.325米、RMSE降至0.793米,边界准确性也明显提升,代价是推理时间从约24.5秒膨胀到约254秒,实际使用中几乎不可能接受这个速度。Marigold-SSD是同一扩散模型框架下经过专门加速优化的版本,通过将扩散步骤压缩为单步来实现快速推理,仅需约0.382秒,MAE为0.422米,RMSE为0.868米,边界完整性指标(E_PDBE_comp=21.107)明显弱于其他方法,说明它对边界细节的恢复能力相对有限。VPP4DC是一种完全不同的思路,它通过在图像上叠加虚拟的结构光投影图案、然后重新训练立体匹配网络来实现深度补全,参数量仅约1100万,推理时间仅约0.116秒,MAE为0.360米,RMSE为0.790米,在MAE和RMSE两项主指标上表现与Marigold-DC集成版相当,但速度快了两千倍以上。
**深度估计**这一类算法的任务更为纯粹:只给一张彩色图,什么其他信息都没有,直接估计每个像素的距离。由于没有任何绝对距离参照,许多此类算法预测的是"相对深度"或"仿射不变深度"(只保证近的比远的小,但具体数值不准),因此需要借助那500个稀疏立体匹配深度点来进行尺度和偏移的对齐校准,校准公式通过最小化最小二乘误差得出一个全局缩放系数和偏移量。
评估指标使用绝对相对误差(REL,越小越好)和δ1(预测值与真实值之比介于0.8到1.25之间的点的比例,越大越好),此外也报告了MAE和RMSE。
Depth Anything v3使用了参数量约13.56亿的GIANT-1.1检查点,推理时间约0.095秒,REL为0.133,δ1为0.834,MAE为0.554米,RMSE为0.852米,在三者中综合表现最优。Marigold-E2E同样基于扩散模型,参数量约9.5亿,推理时间约0.175秒,REL为0.174,δ1为0.727,MAE为0.715米,RMSE为1.016米,各项指标均弱于另外两者。MoGe-2使用ViT-Large检查点,参数量约3.26亿,推理时间仅约0.057秒,这是三者中最快的,它直接预测带有度量尺度的绝对深度,经过尺度和偏移校准后REL为0.142、δ1为0.816,不做任何校准时REL飙升到0.210、δ1跌至0.594,说明其预测的绝对尺度与真实场景存在偏差,但在对齐之后表现颇具竞争力。
六、从这些测试结果中读出的规律
把九种算法在这份数据集上的表现放在一起看,能读出几条清晰的规律。
计算效率与精度之间存在明显的权衡关系。轻量级的算法(如相机内置SGM、VPP4DC、MoGe-2)能以接近实时的速度运行,但在粉尘遮挡严重、光照极端的场景下精度受限;大型深度学习模型(FoundationStereo、StereoAnywhere、Marigold-DC集成版)的精度更高、鲁棒性更强,但推理时间长,有些甚至需要数分钟才能处理一帧,在实际机器人应用中难以接受。
立体摄像头和激光雷达各有擅长。立体摄像头在密度和分辨率上有优势,但在粉尘极重时精度下降明显;激光雷达虽然会被粉尘干扰,但在能见度相对正常时依然能提供稳定的绝对距离参考,只是数据极度稀疏。研究团队在讨论中明确指出,将两者融合(传感器融合)有望实现远超单一传感器的深度感知效果,但要做到这一点,还需要额外的评估数据来量化融合后的提升,这也是未来工作的方向之一。
从神经网络方法与传统算法的对比来看,深度学习模型在处理极暗区域(如图像左侧严重曝光不足的区域)和过曝区域时,依然能生成物理上合理的深度图,且物体边缘更清晰,而传统SGM在这些区域几乎完全失效(大片黑洞)。这表明,神经网络从大量训练数据中学到的"世界知识"确实帮助它在局部信息严重缺失时做出合理推断。
归根结底,这份数据集证明了一件重要的事:在喷射混凝土这种极端环境下,深度感知并非不可能,而是完全可行的——现有的算法已经能做到有意义的测量,只是精度和速度之间还需要进一步取得平衡。这也意味着,让机器人完全自主地完成喷射混凝土作业,在感知层面已经看到了现实路径。
对于那些热衷于自动化施工、矿山机器人、隧道检测或者任何需要在恶劣光学条件下工作的视觉系统的研究者和工程师来说,ShotcreteDepth数据集和配套的标注工具提供了一个此前从未有过的起点。完整的数据集、标注工具和实验代码均已开源,有兴趣的读者可以在GitHub搜索"dtu-pas/shotcrete-depth"找到项目仓库,或通过arXiv编号2606.23152查阅原始论文。
Q&A
Q1:ShotcreteDepth数据集和普通深度感知数据集有什么不同?
A:ShotcreteDepth专门针对喷射混凝土施工环境采集,包含大量粉尘弥漫、照明恶劣的真实场景,激光雷达数据还带有粉尘云干扰点的人工标注。普通深度数据集(如自动驾驶的KITTI)基本在正常室外光照条件下采集,不包含这类极端工业环境,无法直接用于评估机器人在粉尘环境中的感知能力。
Q2:激光雷达在喷射混凝土环境中为什么会出现"幻视"问题?
A:喷射混凝土产生大量悬浮微粒,激光束打到这些颗粒上会被反射回来,激光雷达会将这些空中颗粒误识别为实体表面并记录为距离数据,形成实际上并不存在的"障碍物"。摄像头和人眼对这些颗粒基本透明,所以两者看到的场景存在根本性差异,这正是该数据集需要专门标注工具剔除粉尘点的原因。
Q3:ShotcreteDepth数据集支持哪些类型的算法研究?
A:该数据集支持三类深度感知算法的开发与评估:立体匹配(利用左右两张图像计算距离)、深度补全(结合稀疏激光雷达点和图像填充完整深度图)以及单目深度估计(仅凭单张图像推断距离)。数据集还可用于研究粉尘对传感器的影响规律,以及多模态传感器融合方法。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.