无人机飞进峡谷、隧道或者被信号干扰的区域,GPS 一旦失效,它靠什么判断自己在哪里?一个常见的思路是让无人机把拍到的地面图像和卫星地图做匹配,就像人拿着地图找自己站在哪条街上。但这里藏着一个麻烦:无人机飞得高,拍到的地面范围就大;飞得低,范围就小。同一张卫星地图,对应不同高度拍出来的图像,尺度完全对不上,匹配自然容易出错。
清华大学等机构的研究者最近提出了一套名为 AE-VPR 的框架,试图解决这个尺度失配问题。他们的思路有点反常规:不直接去估计无人机的高度数值,而是先把图像转换到频域,用分类的方式预测相对离地高度,再根据这个高度对图像做裁剪归一化,最后完成无人机图像和卫星地图的匹配。在四组数据集上,引入高度估计模块后,检索准确率 R@1 和 R@5 平均提升了 41.50 和 56.83 个百分点。
![]()
为什么频域能帮上忙?
研究者对 RGB 图像的每个通道做空间移位后,计算二维 FFT(快速傅里叶变换),取对数幅值谱作为频域表征。这里的关键观察是:高度变化会改变图像中高频分量的占比。飞得越高,地面细节在图像中越密集,高频成分的比例也随之变化。相比原始空间域图像,频域特征对尺度变化更敏感,这让一个轻量分类网络就能可靠地预测相对离地高度。
把高度预测转化为分类任务,还有一个实际好处:分类比回归更容易训练,也更稳定。预测出高度后,系统据此对查询图像做尺度归一化裁剪,消除飞行高度变化带来的尺度失配。这个模块被接入 MixVPR、CosPlace 等多种主流视觉定位基线后,均显示有效,说明它具备一定的通用性。
质量自适应分类器与加权坐标估计
除了高度估计,框架里还有两个值得注意的组件。一个是质量自适应分类器(QAMC),它结合图像锐度(拉普拉斯响应的空间方差)和特征范数,合成一个样本质量因子,动态缩放角度损失的 margin。简单说,图像模糊时,分类器的决策边界会相应调整,避免在低质量输入上做出过于自信的判断。
另一个是加权坐标估计(WCE)。传统的做法是直接取 Top-1 匹配结果作为定位输出,但 WCE 会综合多个候选位置的置信度做加权估计。实验数据显示,在 100 米范围内,这种方式的定位成功率明显优于直接选取 Top-1。
真机上的表现与局限
研究者没有只停留在仿真层面。在 RTX 4090 工作站上,完整流水线的平均延迟为:RAE 模块 10.7ms,裁剪 12.4ms,VPR 分类 50.6ms,FAISS 检索仅 1.5ms,整体达到 13.3 FPS,峰值显存占用低于 600MB。这个性能水平意味着它可以部署在中小型无人机上,执行在线的地理初始化任务。
不过论文也坦承了现有方案的几项局限。单一全局高度假设无法处理地形起伏剧烈的场景;农田等纹理稀疏区域,频域表征的区分度会下降;两阶段独立训练导致高度误差会向下传递;系统强依赖预存的高清卫星地图,在完全未知的环境里无法工作。未来方向包括端到端联合训练、统一主干网络、语义结构融合等。
这套方案的价值在于,它把"高度估计"从辅助信息变成了视觉定位的关键一环,而且用频域分析把回归问题转化为分类问题,降低了训练难度。对于无人机在 GPS 拒止环境下的自主导航,这算是一个务实的推进。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.