网易首页 > 网易号 > 正文 申请入驻

激光雷达点云补全提速2.3倍:当"初始化"本身被教会思考

0
分享至


你有没有想过,自动驾驶汽车"看"世界的方式,其实一直带着一堆窟窿?

激光雷达每秒扫描周围环境,生成的点云数据听起来很酷,但现实很骨感:远处的物体点数稀疏得可怜,被遮挡的区域干脆就是一片空白。一辆车挡住了后面的护栏,一堵墙遮住了拐角处的行人,这些看不见的地方,对自动驾驶系统来说就是盲区。而想让车辆做出安全决策,你得先把这些盲区"猜"出来,这个过程叫做**场景补全**。

场景补全*:根据激光雷达采集到的不完整点云,推测并重建出完整、连贯的三维场景,填补遮挡和稀疏区域缺失的几何信息。

问题是,补全这件事,现有方法要么补得慢,要么补得糙,鱼与熊掌不可兼得。这篇来自德国埃尔朗根-纽伦堡大学的论文,提出了一个叫RapidLiDAR的方法,试图同时啃下这两块硬骨头。

核心问题:初始化决定了一切

要理解这篇论文在解决什么,得先搞懂一个业内的共识套路:几乎所有场景补全方法都遵循"先粗略搭个框架,再精细打磨"的两步走思路,专业说法叫**初始化-精修范式**。

初始化-精修范式*:先快速构造一个粗糙的场景估计(初始化),再通过网络将其逐步细化为完整、精确的三维几何结构(精修)。这就像装修房子先搭骨架再贴瓷砖,骨架搭歪了,瓷砖贴得再好看也是歪的。

那么问题来了:这个"骨架"该怎么搭?

目前主流的做法分成两派。第一派是基于扩散模型的生成方法,比如LiDiff、ScoreLiDAR这些工作,它们的初始化方式简单粗暴:直接从纯随机的高斯噪声开始。

扩散模型*:一种生成式AI技术,通过反复给数据加噪声再学习去噪的过程,训练网络从纯噪声中一步步"提炼"出真实数据。图像生成领域的Stable Diffusion就是用了这套原理。

用随机噪声当起点听起来挺离谱的,但这确实是扩散模型的看家本领:完全不知道答案,靠一步步猜逐渐逼近真相。问题是,这个"逐渐逼近"的代价极其高昂。LiDiff完成一次场景补全要花30.1秒,ScoreLiDAR也要7.1秒。

这里必须打个比方,而且得打得准。这就像你要拼一幅一万片的拼图,别人给你一堆散落满桌子的碎片当参照(哪怕它是错的),而扩散模型的做法是先把所有碎片扔进搅拌机打成粉末,再一点点从粉末里"猜"出原来的拼图长什么样。如果不这样做,去跳过这个从头猜起的过程,会怎样?答案是扩散模型压根跑不起来,因为它的整个数学框架就建立在"从纯噪声去噪"这个假设上,这是它的天生基因,改不了。但代价也很明显:从粉末到成品,中间要经历成百上千次迭代计算,速度自然慢得离谱。

第二派是最近才出现的非生成式方法,代表作是LiNeXt。它换了个思路:既然扩散模型从零开始太慢,那我干脆直接拿已经观测到的部分点云当起点,往这些点上加一点固定强度的随机扰动,把点的数量"复制"膨胀到目标规模,然后一次性精修,不用反复迭代。

这个思路聪明在哪?它不用从粉末重新拼图了,而是直接把手头已有的碎片摊开,在每个碎片周围撒一把差不多大小的新碎片,然后一次性把整幅图拼完。速度确实快了不少,LiNeXt只需要0.23秒。

但新问题来了。论文里有一个数据让我很在意:LiNeXt的扰动是"固定噪声强度",也就是说不管这个点周围到底是稀疏还是密集,撒出去的扰动范围都一样大。这意味着如果前方有一大片完全没被激光雷达扫到的区域(比如一辆车完全挡住了后面几米的空间),LiNeXt撒出去的点因为扰动幅度有限,根本够不着那么远,最后留下的还是一片空洞。而且更麻烦的是,这个固定的噪声强度是针对某个具体数据集调出来的超参数,换一个激光雷达型号、换一个点密度不同的传感器,这个参数就得重新手动调,费时又不通用。

这就是本文作者盯上的突破口:能不能让"初始化"这一步本身,变成一个会思考、会根据周围环境自适应调整的过程,而不是靠人拍脑袋定一个固定数值?

自适应初始化模块:让每个点自己决定要走多远

RapidLiDAR的第一个核心创新,叫做**自适应初始化模块**(Adaptive Initialization Module,简称AIM)。

自适应初始化模块*:一个可学习的网络组件,为输入点云中的每一个观测点预测一个"专属"的空间位移方向和距离,而不是用统一的固定噪声强度进行扰动。

具体怎么做的?先把输入的稀疏点云复制扩增到目标点数(比如原始1.8万个点扩增到18万个点),然后加一点小噪声避免完全重复。接下来关键的一步是,网络会为每一个点提取一个融合了局部几何和整体场景信息的特征向量,再用一个多层感知机预测出这个点该往哪个方向、挪动多远。

这里有个细节值得展开:稀疏区域和遮挡区域周边的点,网络学出来的位移会更大,因为这些地方"缺东西",需要伸得更远去填补空白;而本来就密集的区域,点几乎不用怎么挪动,因为那里已经够密了,再挪反而添乱。

这就好比同一个班级里,老师让学生去帮忙擦黑板上不同区域的字迹。字迹本来就淡的地方(密集区域),学生轻轻擦一下就行;但如果黑板某个角落完全是空白(遮挡区域),老师会派更多学生去补写内容,而不是让原本负责擦黑板中央的学生随便晃两步就算完成任务。如果不这样区别对待,会怎样?就是论文图1里展示的那种情况:LiNeXt的初始化图里,那片被高亮框出来的大遮挡区域,从始至终都是一片空白,因为固定噪声压根没让任何点"跑"到那么远的地方去。而扩散模型虽然理论上能覆盖任意区域(因为它从纯噪声开始),但由于起点完全不携带场景信息,反而需要更多计算步骤才能"想明白"该往哪填。

论文中给出的实验数据很能说明问题。做消融实验时,去掉自适应初始化模块(换回固定噪声扰动),倒角距离(衡量补全精度的核心指标,数值越小越好)从0.206涨到了0.218,JSD指标也全面变差。这说明这个"会思考的初始化"确实不是锦上添花,而是实打实提升了补全质量。

倒角距离(Chamfer Distance,简称CD)*:衡量预测点云和真实点云之间几何差异的标准指标,计算方式是双向地找最近邻点求距离平方和再取平均,数值越小说明预测点云和真实场景越接近。

多尺度重建模块:用"变形注意力"代替笨重的近邻搜索

光有一个聪明的起点还不够,接下来要把这个粗糙的初始化打磨成真正连贯、精细的场景,这就是第二个核心组件——**多尺度重建模块**要做的事。

多尺度重建模块*:利用从输入点云提取出的多种分辨率的三维体素特征和二维鸟瞰图特征,通过跨注意力机制精修每个点的最终位置,使其贴合真实场景表面。

在讲这个模块之前,得先说说传统点云处理里一个绕不开的老大难问题:如何让每个点获取到"周围到底长什么样"的信息?

过去的主流做法是用**最远点采样**和**k近邻搜索**这类操作。

最远点采样(Farthest Point Sampling,简称FPS)和k近邻搜索(k-Nearest Neighbor,简称k-NN)*:两种经典的点云处理算法,前者用于从海量点中挑选出分布最均匀的一批代表点,后者用于给每个点找到空间上离它最近的若干邻居,从而聚合局部信息。这两种操作都需要对点与点之间的空间关系做显式计算。

问题出在这两个操作的计算成本上:随着点数增多(一个完整场景动辄十几二十万个点),FPS和k-NN的计算量会急剧膨胀。这就好比你要给全班一百个同学按座位远近排队,一百人还好办,可如果是十万人站在操场上,让每个人都去找"离我最近的十个人是谁",这个搜寻和排序的工作量会呈爆炸式增长,而且这活儿还没法简单地拆开让不同的计算单元并行处理,因为"谁离谁最近"本身就依赖于其他点的位置信息,环环相扣。LiNeXt虽然靠着高度优化的定制CUDA代码库勉强把这类操作的耗时压下去了,但终究是戴着镣铐在跳舞,速度提升有极限。

RapidLiDAR的做法是釜底抽薪:干脆不用FPS和k-NN了,改用体素化和鸟瞰图这类基于规则网格的特征提取方式。

体素化*:将连续的三维空间切割成一个个规则的小立方体格子(体素),每个格子记录该区域是否被点云占据,从而把不规则的点云数据转换成规则的网格数据,便于用标准卷积神经网络处理。

鸟瞰图(Bird's-Eye-View,简称BEV)*:从空中俯视的视角把三维场景压缩投影成二维平面图,常用于自动驾驶感知任务中,因为大部分道路场景的关键信息在水平面上分布,压缩掉高度维度能大幅降低计算量。

具体流程是这样的:输入点云先被体素化,然后经过一连串三维卷积层,每次下采样一半,得到多个不同分辨率的体素特征。这些体素特征虽然抓住了精细的几何细节,但因为激光雷达点云本身就稀疏,绝大多数体素格子是空的,信息密度不够。于是论文又设计了一个**密集BEV头**,把最后一层体素特征压扁投影成二维鸟瞰图,再用多头自注意力机制让每个位置都能"看到"全局的场景上下文,弥补稀疏区域信息不足的问题。

密集BEV头(Dense BEV Head)*:一个把稀疏的三维体素特征转换成信息稠密的二维鸟瞰图特征的网络模块,核心步骤包括维度压缩、卷积投影、自注意力全局建模和残差卷积精修。

有了这套多尺度的体素特征和BEV特征之后,怎么让每个点去"查询"这些特征呢?这里用到了这篇论文的另一个关键武器:**多尺度可变形注意力**。

多尺度可变形注意力(Multi-Scale Deformable Attention)*:一种注意力机制,让每个查询点只在特征图上少数几个学习出来的采样位置处提取信息,而不是像标准注意力那样对特征图上所有位置都算一遍,从而大幅降低计算复杂度。这个技术最早出现在Deformable DETR这篇目标检测论文里。

标准的跨注意力机制,理论上要让每一个输出点都去和所有的上下文特征位置逐一计算关联度,这个计算量是查询点数乘以上下文位置数。当查询点数量高达十几万个的时候,这个计算量会大到不可接受。而可变形注意力的巧妙之处在于,它只让每个点去看几个"精挑细选"出来的采样位置,而具体看哪几个位置,是网络自己学出来的。

这就好比你去图书馆找一本书的相关资料,笨办法是把图书馆每一层每一个书架都翻一遍(标准注意力),聪明办法是你已经大致知道这类书通常放在哪几个特定书架,直接奔过去查(可变形注意力)。如果不用这种"精准定位"的方式,会怎样?以这篇论文的场景规模来说,十几万个点乘以几万个特征网格位置,这个计算量在实时场景下是完全跑不动的,可变形注意力正是为了解决这个矛盾而生的。

论文里还提到一个工程细节挺有意思:现成的可变形注意力实现主要是给二维特征图优化的,对三维体素特征不友好。所以作者干脆把每一层三维体素特征也都投影成对应的二维BEV特征图,这样一共凑出五层不同尺度的BEV特征(四层体素来源加一层密集BEV),全部用于可变形跨注意力的查询。最终网络会预测出一个残差位移,把粗糙初始化的点位置进一步微调,让它们精准地贴合到真实场景的表面上去。

同样做了消融实验验证这个模块的价值:去掉多尺度重建模块,直接用初始化的结果作为最终输出,倒角距离从0.206恶化到0.215。这说明单靠聪明的初始化还不够,精修这一步同样功不可没。

速度对比:0.1秒意味着什么

说了这么多设计细节,最终要看的是实打实的效果。论文在SemanticKITTI和KITTI-360这两个自动驾驶领域的标准数据集上做了实验。

SemanticKITTI和KITTI-360*:两个广泛用于自动驾驶感知研究的公开激光雷达数据集,包含大量真实道路场景的点云及语义标注,是评测场景补全、语义分割等任务的常用基准。

先看精度表现。

| 方法 | SemanticKITTI CD↓ | KITTI-360 CD↓(零样本迁移) |

| LiDiff | 0.434 | 0.564 |

| ScoreLiDAR | 0.406 | 0.472 |

| LiNeXt | 0.214 | 0.217 |

| **RapidLiDAR(本文)** | **0.206** | **0.211** |

值得一提的是KITTI-360这一栏的数字,是模型完全没在这个数据集上训练过、直接拿去测试得到的结果,专业说法叫**零样本迁移**。

零样本迁移(Zero-shot Generalization)*:模型在没有针对目标数据集做任何微调训练的情况下,直接应用于该数据集并评估性能,用于检验模型的泛化能力是否只是"背题"背出来的。

RapidLiDAR在这种跨数据集的严苛测试下依然保持了最优表现,说明它学到的不是某个数据集的"小聪明",而是真正通用的场景补全能力。

再看速度对比,这才是这篇论文最想突出的地方。

| 方法 | 倒角距离↓ | 参数量(百万)↓ | 推理时间(秒)↓ |

| LiDiff | 0.434 | 32.67 | 30.1 |

| ScoreLiDAR | 0.406 | 32.67 | 7.1 |

| LiNeXt | 0.214 | 1.99 | 0.23 |

| **RapidLiDAR** | **0.206** | 11.8 | **0.10** |

0.1秒完成一次完整场景补全,是此前最快方法LiNeXt的2.3倍速度提升,同时精度还更好。而且这个速度是在没有使用任何定制CUDA加速代码的情况下达成的,纯靠标准库操作。这个对比意味着什么?意味着RapidLiDAR的0.1秒,已经能匹配上主流车载激光雷达10Hz的扫描频率,也就是每秒采集10次数据。这是个实打实的里程碑,因为如果补全速度跟不上传感器采集速度,那补全模块在实际车辆上就只能"选择性使用"或者靠丢帧来凑合,而现在终于可以做到"扫一帧、补一帧、无缝衔接"。

体素分辨率η的选择也做了消融实验:分辨率越精细(η数值越小),补全精度越好,但参数量和推理时间也会略微上升。作者最终选择了0.3米作为默认设置,在精度、参数量和速度三者间取得平衡,同时论文也强调这个分辨率是可以根据实际需求调整的,架构本身具备这种灵活性。

写在后面

读完这篇论文,我印象最深的其实是那个关于"初始化"的洞察。这个领域过去几年一直在琢磨怎么把"精修"这一步做得更快更好,扩散模型加速、蒸馏、Flow Matching各种花活层出不穷,但很少有人认真想过,起点本身是不是也可以被教会思考。这有点像大家都在琢磨怎么让赛车跑得更快,却没人注意到起跑线画歪了。

另一个让我意外的地方是,论文里提到LiNeXt明明用了定制CUDA代码去加速FPS和k-NN,跑起来还是比RapidLiDAR慢一倍多,而RapidLiDAR完全没上任何硬件级优化,靠的纯粹是算法本身的复杂度更低。这说明有时候解决速度问题的正确姿势不是"把慢的东西优化得快一点",而是"干脆换一种压根不慢的做法"。

论文最后坦承的一个局限也值得琢磨:不同激光雷达传感器的波束几何差异(比如16线、32线、64线雷达扫描模式完全不同)目前还没有专门验证过。这个问题其实挺现实的,毕竟工业界用的传感器型号五花八门,一个模型能不能真正做到"即插即用",这道题还没完全解开。

Q&A

Q1:RapidLiDAR是什么?

A:RapidLiDAR是德国埃尔朗根-纽伦堡大学团队提出的一种激光雷达场景补全方法,核心创新是让场景初始化本身变成可学习的自适应过程,同时用体素和鸟瞰图特征替代传统的近邻搜索操作,实现了0.1秒完成一次完整场景补全,比此前最快方法快2.3倍。

Q2:RapidLiDAR相比LiNeXt和扩散模型方法有什么优势?

A:相比扩散模型(如LiDiff、ScoreLiDAR)需要多次迭代去噪、耗时数秒到几十秒,RapidLiDAR一次前向传播就能完成补全;相比LiNeXt使用固定噪声强度扩展点云、无法灵活覆盖大范围遮挡区域,RapidLiDAR的自适应初始化模块能根据局部场景稀疏程度动态调整位移幅度,且精度和速度都更优。

Q3:RapidLiDAR能否直接用在不同型号的激光雷达上?

A:论文在KITTI-360数据集上做了零样本迁移测试,模型未经微调直接应用也取得了最优表现,说明具备较好的跨数据集泛化能力。但论文也坦承,针对不同传感器波束几何差异的鲁棒性验证是未来需要进一步研究的方向。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

瞎说娱乐
2026-08-22 16:07:15
高考阅卷老师说真话:550分、600分、650分,分别意味着什么

高考阅卷老师说真话:550分、600分、650分,分别意味着什么

户外阿毽
2026-09-01 10:31:07
1991年,苏联公布“永不开启”的斯大林绝密档案,世人被欺骗50年

1991年,苏联公布“永不开启”的斯大林绝密档案,世人被欺骗50年

文史达观
2025-04-16 06:45:16
三战70+19已具统治力!埃奇库姆又强壮一档 名宿:史上最强第五巨头

三战70+19已具统治力!埃奇库姆又强壮一档 名宿:史上最强第五巨头

颜小白的篮球梦
2026-09-02 08:27:03
微短剧统一标识启用

微短剧统一标识启用

经济观察报
2026-09-01 15:33:36
王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

可乐谈情感
2026-08-30 07:27:10
吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

唠叨说历史
2026-01-07 12:42:21
邵氏"五虎将"现状:狄龙功成身退,李修贤当网红,只有他俩已去世

邵氏"五虎将"现状:狄龙功成身退,李修贤当网红,只有他俩已去世

娱圈办事处
2026-09-02 18:58:42
烟草局收入拉响警报,是国民之福!

烟草局收入拉响警报,是国民之福!

博客弹今
2026-09-02 18:27:24
曝香港武打巨星陈观泰去世,享年80岁,四婚娶小30岁娇妻,晚年定居内地

曝香港武打巨星陈观泰去世,享年80岁,四婚娶小30岁娇妻,晚年定居内地

裕丰娱间说
2026-09-02 12:51:40
高圆圆首谈死亡:已和赵又廷商量好“谁先走”

高圆圆首谈死亡:已和赵又廷商量好“谁先走”

可乐谈情感
2026-09-02 10:38:37
女排教练组强硬表态!不靠朱婷也能打,全新建队思路引全网热议

女排教练组强硬表态!不靠朱婷也能打,全新建队思路引全网热议

体育见习官
2026-09-02 10:44:47
美国共损失48架MQ-9!本来要被淘汰,却在伊朗战场打成“MVP”

美国共损失48架MQ-9!本来要被淘汰,却在伊朗战场打成“MVP”

金十数据
2026-09-01 10:50:13
切尔西含泪净赚2400万,曼城却抢着给恩佐刷1.45亿:到底谁疯了?

切尔西含泪净赚2400万,曼城却抢着给恩佐刷1.45亿:到底谁疯了?

落夜足球
2026-09-02 21:23:07
华列兵履新,已升副部级

华列兵履新,已升副部级

上观新闻
2026-09-02 10:33:40
日本一个字也不提中国!很显然,日本不表态,就是不同意!

日本一个字也不提中国!很显然,日本不表态,就是不同意!

扶苏聊历史
2026-09-02 16:34:06
比赖清德更极端!如若2028年她执掌台湾,武力收台或将到来?

比赖清德更极端!如若2028年她执掌台湾,武力收台或将到来?

混沌录
2026-08-30 21:25:08
“子涵、梓萱”一代结束了?今年新入学的小学生,名字都超惊艳!

“子涵、梓萱”一代结束了?今年新入学的小学生,名字都超惊艳!

铭记历史呀
2026-09-02 02:13:19
GTA6丰臀露西娅全身展示来了!美乳肉腿玉足太吸睛

GTA6丰臀露西娅全身展示来了!美乳肉腿玉足太吸睛

游民星空
2026-09-01 16:30:43
原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

扶苏聊历史
2026-09-02 17:28:54
2026-09-02 23:12:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9721文章数 568关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

章泽天专访何超琼 后者辟谣"赌王传言"公开成长经历

头条要闻

章泽天专访何超琼 后者辟谣"赌王传言"公开成长经历

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

艺术
数码
游戏
旅游
教育

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

数码要闻

华为海外发布FreeBuds Neo降噪耳机:短柄设计,首发109欧元

索尼发行的JRPG!PSP经典重制重大变动:工作室换了

旅游要闻

忻州荷花开 遍地是吾乡

教育要闻

幼稚!高考全省260名瞧不上2600名室友要退学,港中深校长当场说:半年后谁厉害还不一定

无障碍浏览 进入关怀版