![]()
这项由澳大利亚墨尔本大学独立完成的研究,于2026年7月14日以预印本形式发布在计算机视觉领域的学术平台arXiv上,论文编号为arXiv:2607.12544v1,有兴趣深入了解的读者可以通过该编号查询完整论文。
设想这样一个场景:深夜的山林中,一场搜救行动正在进行。普通摄像机在漆黑中几乎看不到任何东西,但热成像摄像机能够捕捉到一切发出热量的物体——人体、动物,乃至空中飞行的无人机。问题是,当天空中同时有好几架无人机飞行时,系统怎样才能持续、准确地追踪每一架,既不丢失目标,又不把树梢的热气误认为是无人机?更棘手的是,这套系统还必须足够轻巧,能跑在边境巡逻车、搜救直升机这类资源有限的设备上,而不是依赖一台价格不菲的数据中心服务器。
这正是这篇研究试图解决的核心问题。研究团队围绕一种他们称为"自适应运动学卡尔曼滤波器"的技术,构建了一套专门针对热成像无人机追踪的完整解决方案。在深入了解这套方案之前,有必要先理解一下追踪无人机究竟难在哪里,以及现有方法为何力不从心。
一、追踪无人机:比你想象的难得多
把追踪无人机的任务比作在人群中盯住一个穿黑衣服的人,而且这个人跑得飞快、时不时钻进人群消失几秒钟,你大概能感受到一些难度。但热成像无人机追踪比这还要复杂。
热成像摄像机拍到的画面和普通相机非常不同——它看到的是热量分布,而非颜色和纹理。远处的无人机在热成像画面里可能只是一个几个像素大小的亮点,几乎没有任何外观特征可以辨认。更糟糕的是,热成像传感器本身有一种叫做"传感器抖动"的毛病,就像手抖时拍出来的照片会模糊一样,这种抖动会让追踪系统误以为目标在乱跑。与此同时,无人机的飞行方式也不规律——它们可能急转弯、突然加速、或者短暂被建筑物遮挡,这些情况都会让追踪系统"失联"。
现有的主流追踪方法,比如学界流行的ByteTrack和BoT-SORT,通常采用一种叫做"卡尔曼滤波器"的数学工具来预测目标下一帧的位置,再把这个预测和摄像机实际拍到的检测结果匹配起来。卡尔曼滤波器可以理解为一个非常精明的"位置预言家":它根据目标过去的运动轨迹,推测目标接下来会出现在哪里。
然而,标准卡尔曼滤波器有一个根深蒂固的假设——它认为目标会保持匀速直线运动。这就像假设高速公路上所有车辆都不会变道、不会刹车一样。对于无人机这种动作灵活的飞行器,这个假设显然不成立。当无人机突然变向,或者短暂消失在摄像机视野之外时,"匀速直线"的预测会越来越偏,最终追踪彻底失效。
另一方面,有些更复杂的数学工具,比如"扩展卡尔曼滤波器"或"无迹卡尔曼滤波器",确实能处理更复杂的运动模式,但它们的计算量也大得多。在一台搜救无人机上搭载的边缘计算芯片上,跑这些复杂算法几乎是奢望——就像让一辆小电驴拖一节高铁车厢,力气不够。
研究团队面临的挑战因此非常清晰:既要比标准卡尔曼滤波器聪明,能应对无人机的复杂运动;又要比那些复杂算法轻巧,能在资源受限的设备上实时运行。
二、热成像追踪的"大脑升级":自适应运动学卡尔曼滤波器
研究团队的核心创新是对标准卡尔曼滤波器进行了一次精巧的"脑外科手术"——不是把它整个换掉,而是在它原有的框架内植入三个新的判断机制,让它能够根据当前情况灵活调整自己的预测策略。这套升级版滤波器被命名为"自适应运动学卡尔曼滤波器",英文缩写为AKKF。
理解这三个机制,可以借助一个统一的比喻:把卡尔曼滤波器想象成一位经验丰富的航空交通管制员,他负责追踪雷达屏幕上的飞行目标。标准版管制员只会机械地用"上一秒的速度乘以时间"来预测目标位置。而AKKF版管制员则更聪明——他学会了三种特殊情况下的应对策略。
第一种策略叫做"面积自适应运动阻尼"。当管制员注意到雷达屏幕上的目标很小(说明无人机距离很远)时,他会意识到:这么小的目标一旦从雷达上消失,如果继续用之前测到的速度去推算它的位置,误差会越来越大,就像瞄准靶心时手抖了一下,越往后偏得越离谱。因此,这位聪明的管制员会主动"踩刹车"——随着目标在屏幕上越来越小,他会逐渐减弱对速度的信任,让预测位置更保守地停在最后确认的地点附近,而不是盲目地往前推。技术上讲,这是通过一个与目标边界框面积挂钩的阻尼系数来实现的,目标越小,速度衰减越快。
第二种策略叫做"透视感知速度制动"。当无人机正在远离摄像机飞去时,它在画面里看起来会越来越小,对应的"尺寸变化速度"也是负值(宽度和高度都在缩小)。标准卡尔曼滤波器如果持续相信这个缩小趋势,最终会预测目标缩小到消失,这显然不符合物理常识。聪明的管制员因此引入了第二条规则:当目标已经非常小时,他会限制"继续缩小"的预测幅度,防止目标在数学层面上"消失"。这个限制的强度与目标当前的实际尺寸成反比——目标越小,限制越强。
第三种策略叫做"动态测量噪声估计"。热成像环境非常嘈杂,摄像机有时会错误地把一块热的墙面或者一片热气检测为无人机,产生一个形状异常的"虚假目标框"。管制员怎么判断一个新检测结果是否可信?他会对比这个新检测框的长宽比和自己预测的长宽比:无人机的形状不会在一帧之内突变,如果检测到一个长宽比和预测差异悬殊的框,说明这个检测很可能是噪声,管制员会降低对它的信任,更多依赖自己的预测。这种对检测结果可信度的动态调整,正是第三个机制的精髓。
这三个机制的共同点在于:它们都不需要额外引入复杂的非线性数学,而是通过修改卡尔曼滤波器内部的几个参数来实现。计算开销的增加是有限的,这确保了整个系统仍然能够在边缘设备上实时运行。
三、让追踪更可靠的两个"辅助技能"
仅有更聪明的滤波器还不够,研究团队还为追踪流程配备了两个实用的辅助工具,专门针对热成像无人机追踪中的两个顽固痛点。
第一个工具叫做"瞬态假阳性抑制",可以理解为一个"冷静期"机制。在热成像画面中,热气流、建筑物反射的热量、甚至飞鸟都可能在某一帧中被检测算法误认为是无人机。如果系统立刻把每一个新检测到的目标都作为真实轨迹输出,就会产生大量只存在一帧的"幽灵轨迹",严重干扰追踪结果。研究团队的解决方案非常直接:只有当一个目标在连续多帧中都被稳定检测到,才把它作为真实轨迹对外输出。这就像医院里对疑似病例的隔离观察期——不是第一天出现症状就立刻确诊,而是观察几天后再下结论。实验数据显示,仅凭这一改动,系统的追踪性能指标(HOTA值)就从0.82357提升到了0.825405,提升明显。
第二个工具叫做"运动学引导预测性滑行",用更通俗的话说就是"失联后的惯性推算"。当无人机短暂被建筑物遮挡、或者传感器抖动导致某一帧的检测失败时,追踪系统不应该立刻宣布"目标丢失",而应该根据目标之前的运动轨迹继续推算它现在可能在哪里。这就像你在人群中追踪一个朋友,他突然转过一个路口消失了一秒——你不会原地发呆,而是继续往前走,因为你知道他大概的方向和速度。研究团队发现,在实验中,无论是标准卡尔曼滤波器还是AKKF,使用一帧的"滑行预测"(即允许系统在失去检测信号后继续推算一帧)时性能最佳,超过一帧后效果反而开始下降。这个一帧的滑行窗口是团队通过系统实验确定的,简洁而有效。
四、拿数据说话:实验设计与测试平台
研究团队使用了一个专门针对热成像无人机追踪的公开基准测试平台,称为"BSB基准"。这个平台的数据来源于"反无人机挑战赛"(一个CVPR 2025年的学术竞赛),包含200个视频序列,其中102个用于训练,98个用于测试。
这些数据的规模和挑战性值得单独描述一下。训练集包含超过77000帧画面,标注了超过163万个边界框;测试集包含近75000帧。所有画面分辨率为640×512像素,非常典型的热成像摄像机输出格式。最关键的是,画面中无人机目标的尺寸极小——平均宽度只有约10个像素,高度约9个像素,面积平均只有117平方像素。打个比方,如果把整张画面想象成一张A4纸,无人机目标大概只有一粒芝麻那么大。这种"微小目标"的追踪难度,远超普通的行人追踪或车辆追踪任务。
为了评估系统的计算效率,研究团队特意使用了一台更接近实际部署条件的消费级笔记本电脑来运行测试:搭载英特尔酷睿i7-12650H处理器、NVIDIA GeForce RTX 4050笔记本显卡(6GB显存)和24GB内存。这与实验室里动辄80GB显存的科研级GPU相比,更能反映实际边缘设备的性能。
追踪性能的评估指标使用的是"HOTA",这是一种综合衡量目标检测准确性和身份关联连贯性的指标。计算效率则直接用每秒处理帧数(FPS)来衡量,并将实时处理的门槛线(即边缘感知阈值)标注在图表中,以直观展示哪些配置能够满足实时部署需求。
研究团队测试了多种检测器与追踪器的组合,包括YOLOv12(nano/small/medium三种规模)、YOLO26(同样三种规模)和RF-DETR(同样三种规模),每种检测器还分别测试了1280和640两种输入分辨率。所有这些组合都配备了原始BoT-SORT追踪器作为基准对比。训练和主要推理实验在NVIDIA H100 80GB的科研GPU上完成,而边缘性能评估则在上述笔记本平台上进行。
五、实验结果:效率与准确性的精妙平衡
在所有测试配置中,RF-DETR Nano检测器配合1280分辨率输入取得了最高的HOTA得分0.8437,代表了纯追踪精度的天花板。然而,这个配置的计算速度相对较慢,并不完全符合边缘部署的实时要求。
研究团队特别筛选出三种"边缘感知候选方案",即在保持足够追踪精度的同时,处理速度能够达到实时阈值的配置:RF-DETR Nano配合640分辨率、YOLO26n配合1280分辨率、以及YOLO26n配合640分辨率。其中,YOLO26n在640分辨率下实现了最佳的速度-精度综合比,优于同分辨率下的YOLOv12n——这个结论在论文的可视化追踪图中也能直接看出,YOLO26n追踪的目标轨迹明显更稳定。
针对AKKF三个组件的逐项消融实验(即每次只加入一个新机制,观察效果变化)在笔记本平台上完成,结果清晰地显示了每个组件的独立贡献。基准配置(标准BoT-SORT加TFPS,不含预测性滑行)的HOTA为0.826116,FPS为132.03。仅加入面积自适应运动阻尼后,HOTA微升至0.826154,速度略降至129.71 FPS。仅加入透视感知速度制动后,HOTA升至0.826196。仅加入动态测量噪声估计后,效果最为显著,HOTA升至0.826441。当三个机制全部启用时,完整AKKF的HOTA达到最高的0.826606,同时将MOTA和IDF1两个辅助指标也推至各自最高值。代价是FPS从132.03降至94.92——仍然处于实时处理范围内,但计算成本有所增加。
还有一个颇为反直觉的发现值得单独强调,研究团队称之为"检测-追踪悖论":检测精度更高的配置,并不一定带来更好的追踪效果。从实验数据的散点图中可以看出,某些AP检测得分较低的配置,反而在HOTA追踪得分上表现更好。这种现象在微小目标追踪领域已有先例,说明检测精度和追踪质量之间的关系远比"检测越准,追踪越好"这个直觉更复杂。对于边缘部署场景来说,这意味着盲目追求检测器精度并不是提升追踪系统整体性能的最优策略。
另一个一致性结论是:提高输入分辨率始终能改善追踪性能。鉴于无人机目标本就极小,降低分辨率会让原本只有几个像素的目标进一步缩水,最终完全消失在画面噪声中,因此这个结论合乎情理。在未来的优化方向上,研究团队指出,与其降低分辨率来换取速度,不如通过模型剪枝和压缩技术来在保持分辨率的前提下降低计算量。
六、这项研究的边界与未来方向
研究团队在论文中非常坦率地呈现了研究的局限性,并在此基础上指出了未来值得探索的方向。
目前这套方案的测试全部在模拟边缘条件的笔记本平台上进行,并非真正的嵌入式边缘设备(如树莓派、Jetson系列等)。真实边缘设备的内存层级、散热特性和指令集架构与笔记本有所不同,因此论文中的FPS数据只能作为参考,真正部署时可能需要进一步适配。
在改进方向上,研究团队提出了三条路径。第一是模型压缩,包括通道剪枝和知识蒸馏,目标是在不降低检测分辨率的前提下大幅削减计算量。第二是更充分地利用时序信息,目前的AKKF主要依赖相邻帧间的运动学关系,而更长时间窗口的运动历史有可能进一步提升对复杂机动的预测能力。第三是在真实的边缘硬件上进行完整的部署验证,将实验室结论转化为工程实践。
从更宏观的视角看,这篇研究处理的问题具有相当的普遍性:在任何需要实时追踪小目标的热成像应用中,无论是边境安防、野生动物监测还是工业设备巡检,这套思路都有一定的参考价值。
说到底,这项研究做的事情可以用一句话概括:它让一个简单但高效的数学工具变得更聪明,同时确保它没有变得更臃肿。追踪热成像画面中飞速移动的无人机,从来都不是一件轻松的事;而在资源受限的设备上做到这一点,更是一道双重约束题。研究团队通过三个精心设计的自适应机制,外加两个针对热成像特有噪声的工程优化,在不牺牲实时性的前提下,让追踪系统在面对无人机突然变向、短暂消失或被虚假热源干扰时,表现得更加沉稳。
那个"检测越准追踪越好"的直觉被实验数据打了脸,这反倒提醒我们:工程系统中的各个模块之间,存在着比直觉更复杂的相互作用关系。提高一个环节的精度,有时反而会在整体系统层面带来意想不到的副作用。对于任何有志于构建实际追踪系统的工程师来说,这或许是这篇论文送出的最实用的警示。未来随着边缘芯片性能的持续提升和模型压缩技术的成熟,这类轻量但智能的追踪方案有望真正走出实验室,进入实际部署的无人机系统之中。
Q&A
Q1:卡尔曼滤波器在无人机追踪中为什么会失效?
A:标准卡尔曼滤波器假设目标做匀速直线运动,但无人机飞行动作灵活,会急转弯、突然加速或被遮挡导致短暂失联。一旦运动不符合匀速假设,滤波器的位置预测会持续偏移,最终导致追踪丢失。热成像环境中传感器自身的抖动也会进一步放大这个问题。
Q2:AKKF和普通卡尔曼滤波器相比速度慢多少?
A:根据论文中的实验数据,在英特尔i7-12650H配合RTX 4050笔记本GPU的平台上,标准BoT-SORT(含TFPS)的处理速度为132.03帧每秒,启用完整AKKF后降至94.92帧每秒,下降约28%,但仍处于实时处理范围之内,满足边缘部署的基本需求。
Q3:热成像追踪和普通摄像头追踪有什么主要区别?
A:热成像摄像机捕捉的是热量分布而非颜色纹理,远距离无人机可能只有几个像素大小,几乎没有外观特征可用于识别。此外热成像画面中存在大量热气、热墙面等虚假热源,极易产生误检。传感器抖动也比普通摄像头更突出,这些都使热成像追踪比普通视频追踪更具挑战性。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.