来源:市场资讯
(来源:计算机视觉研究院)
计算机视觉研究院
![]()
公众号ID|计算机视觉研究院
学习群|扫码在主页获取加入方式
https://pmc.ncbi.nlm.nih.gov/articles/PMC12835050/pdf/41598_2025_Article_33107.pdf
计算机视觉研究院专栏
Column of Computer Vision Institute
本文基于最新旋转检测基线 YOLOv11-OBB,提出一体化协同优化框架 MAR-YOLO,设计 MFAS 自适应特征筛选、改进 AFPN 渐进式特征金字塔、RRD-Head 重参数化旋转检测头三大创新模块,从浅层特征提取、跨尺度融合、旋转框回归全链路同步解决遥感建筑检测三大核心痛点。
PART/1
痛点
高分辨率遥感影像建筑检测长期存在三大相互耦合的核心难点,现有算法只能单独优化单一问题,多问题共存时性能大幅下滑:
:建筑尺寸跨度 8~128 像素,城区建筑密集排布,间距甚至小于网络感受野,小建筑极易漏检;
:非垂直航拍(off-nadir)带来透视畸变,不规则 L/U 型建筑角度回归预测偏差大;
:浅层特征细节丰富、语义弱,深层语义强、空间粗糙,直接拼接易产生语义冲突,误检漏检激增。
现有 YOLO 旋转检测、两阶段旋转 R-CNN、Transformer 检测器均无法同步化解三类问题,为此本文提出MAR-YOLO一体化旋转建筑检测框架,基于 YOLOv11-OBB 做三大协同创新,兼顾检测精度与实时推理速度。
PART/2
创新
整体网络链路:Backbone 骨干 → MFAS 自适应特征筛选 → AFPN 渐进特征金字塔 → RRD-Head 增强旋转检测头
![]()
【MAR-YOLO 整体网络结构图】
(一)MFAS 多尺度特征自适应选择模块
传统 YOLO 仅使用 P3/P4/P5 三层特征,缺失浅层细粒度信息;新增 4 倍下采样 P2 层后会引入大量特征冗余。MFAS 以 FocusedLinearAttention(FLA)为核心,采用双域加权机制:
对 P2/P3/P4 添加可学习权重 α₂、α₃、α₄,P5 复用 C2PSA 注意力搭配 α₅权重;
FLA 内置聚焦因子 p=3 强化建筑边缘、角点提取,搭配 5×5 深度卷积捕捉局部结构;
自适应过滤冗余特征,相比单纯叠加 P2 层,参数量涨幅仅 6.9%,mAP50 额外提升 0.6%。
![]()
【YOLOv11_P2 骨干与添加 MFAS 后的骨干对比图】
(二)改进型 AFPN 渐进式特征金字塔
传统 FPN 自上而下单层传递,跨尺度直接融合造成严重语义鸿沟,本文对渐近金字塔做建筑专属改造:
:先融合相近尺度 P2-P3,再叠加 P4,最后接入 P5,逐层缩小语义差,避免高低层特征直接冲突;
:P2-P3 融合使用 3×3 卷积保留小建筑细节,P4-P5 融合使用 5×5 卷积捕捉长条建筑轮廓;
:每个空间位置设置可学习融合系数 α、β、γ,动态适配城区建筑疏密变化
![]()
【传统 FPN、原始 AFPN、本文改进 AFPN 架构对比图】
(三)基于 RepVGG 重参数化的 RRD-Head 旋转检测头
原有 YOLO 旋转头单路卷积难以学习建筑复杂几何与角度特征,RRD-Head 对分支做任务差异化分工:
三路并行训练分支各司其职:3×3 卷积提取透视畸变下建筑边缘方向特征,1×1 卷积建模通道间角度关联,恒等映射稳定反向传播梯度;
训练时多分支叠加提升特征拟合能力,推理阶段通过重参数化等价转换为单路 3×3 卷积,无额外推理耗时;
专门优化旋转角 θ 回归,大幅降低不规则建筑角度预测漂移问题。
![]()
【原始检测头与 RRD-Head 结构对比图】
PART/3
实验
3.1 消融实验:三大模块协同增益明显
基于斜射建筑专用数据集 BONAI 开展逐层消融,验证每个模块独立贡献与协同效果:
![]()
【完整消融实验结果表】
仅 MFAS:mAP50+0.5%;仅 AFPN:mAP50+0.9%;仅 RRD-Head:mAP50+0.6%;
三者组合完整 MAR-YOLO 相比 YOLOv11s-OBB 基线,mAP50 提升 2.9%、mAP50-95 提升 2.6%,参数量 14.26MB,推理速度稳定 95FPS,兼顾轻量化与实时性。
特征热力图可视化可直观证明:MAR-YOLO 特征激活集中在建筑实体,背景噪声抑制效果远优于基线模型。
![]()
【特征激活热力图对比图】
3.2 主流算法横向对比,全方位碾压 SOTA
在 BONAI、DOTA v1.0、DIOR-R、HRSC2016 四大遥感公开数据集,对比单阶段 YOLO 系列、两阶段旋转检测器、Transformer 旋转 DETR:
![]()
【BONAI 数据集主流算法对比表】
对比 YOLOv9s-OBB(同系列最优单阶段):BONAI 数据集 mAP50 高出 1.8%,推理速度 95FPS 是其 1.04 倍;
对比两阶段 Oriented R-CNN:精度更高,速度提升 3.4 倍;
对比 Rotated DETR:mAP50 高出 2.6~3.7%,计算量仅为其 28.7%。
3.3 定性可视化:密集场景漏检大幅减少
选取密集城区建筑、规整建筑群两大高难度场景对比基线 YOLOv11s-OBB:基线模型存在大量小型建筑漏检,MAR-YOLO 检出目标数量接近真值标注,边界与旋转角度拟合更精准。
![]()
【检测结果定性对比图】
3.4 跨数据集泛化测试,鲁棒性拉满
在航空多目标 DOTA、光学小目标 DIOR-R、舰船数据集 HRSC2016 上,MAR-YOLO 均稳定取得最优指标:
![]()
【多数据集泛化性能验证表】
跨数据集消融结果显示:MFAS 对尺度差异大的建筑场景增益最高,AFPN 全场景稳定增效,RRD-Head 对多角度不规则目标提升显著,证明三大创新解决底层通用检测缺陷,非数据集过拟合。
3.5 失效案例分析:现存局限与优化方向
论文总结三类模型失效场景,为后续研究指明方向:
![]()
【典型失效案例标注图】
建筑极端密集、间距极小:特征融合时目标边界融合,出现合并检测框;
大倾角航拍透视畸变:建筑边缘梯度弱化,角度预测出现偏移;
大面积遮挡场景:深层语义覆盖浅层细节,小目标丢失。
PART/4
总结与未来展望
4.1 核心结论
MAR-YOLO 基于 YOLOv11-OBB 搭建 MFAS、改进 AFPN、RRD-Head 三大协同模块,同步解决遥感建筑尺度、旋转、语义融合三大痛点;
BONAI 数据集指标 87.2% mAP50、65.3% mAP50-95,推理 95FPS,平衡高精度与实时落地需求;
四大公开遥感数据集验证强泛化能力,可适配建筑、舰船、飞机等各类旋转遥感目标检测。
4.2 后续研究方向
轻量化知识蒸馏:压缩模型,适配无人机、星载边缘设备部署;
大模型融合:结合视觉语言模型实现零样本罕见建筑检测,扩散模型扩充极端场景数据;
时序扩展:搭建多时相检测框架,实现城市建筑变化自动监测、灾后损毁评估。
有相关需求的你可以联系我们!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.