网易首页 > 网易号 > 正文 申请入驻

ECCV 2026 Oral|首个端到端实时 DETR 旋转检测模型,中科大联合华为发布 RiO-DETR:2.7 ms 达到 78.4 AP50

0
分享至



遥感影像、交通感知、场景文字识别等任务中,待检测目标很少横平竖直规整排布。采用水平边界框做检测,虽然能够包住目标,但常会纳入大量无关背景;改用旋转框虽能更贴合物体轮廓,可新增的角度维度会显著提升检测器的训练与调参难度,想要在终端设备上实现实时推理更是一大挑战。

以往旋转目标检测追求速度的方案,基本都以 CNN 架构为主。DETR 框架优势突出,端到端的形式还省去了 NMS 后处理;但一旦从水平框拓展至旋转检测,繁重的注意力运算、角度周期性歧义问题,再加上更为复杂的匹配搜索空间,很容易直接丢掉实时推理能力。

最近,中科大联合华为、清华等机构提出了 RiO-DETR,终于把端到端旋转检测推到了真正的实时区间。在 DOTA-1.0 单尺度设置下,最轻量的 RiO-DETR-n 仅有 4.0M 参数,端到端延迟低至 2.7ms,AP50 却能达到 78.4;而最强的 RiO-DETR-x 在 29.9ms 下跑出 81.8 AP50。该工作已被 ECCV 2026 接收为 Oral(Spotlight)。

该论文的第一作者为胡张驰,中国科学技术大学博士研究生,研究方向为通用视觉、视频生成与世界模型。迄今已在 ICCV、ECCV、AAAI、ACM MM 等顶级会议发表多篇论文,是当前目标检测领先模型 D-FINE 的重要贡献者。本文由孙晓艳教授、李和倍博士和彭岩松博士共同指导,作者团队还包括来自华为技术有限公司、清华大学的研究人员。



RiO-DETR 在 DOTA-1.0 上的参数量、延迟、计算量与精度对比。图片来源:论文 Figure 1

这篇论文从模型结构、训练策略到部署效率,做了全方位的考量。它的目标很清晰:不只要让旋转检测的精度再上一个台阶,更要让基于 DETR 的旋转目标检测模型真正具备实时运行的能力。

更值得关注的是,RiO-DETR 并不是简单给 RT-DETR 多接一个角度回归头。作者重新审视了一个更根本的问题:角度究竟应该被当作普通坐标,还是一种由视觉内容决定、且生活在周期空间里的变量?



  • 论文标题:RiO-DETR: DETR for Real-time Oriented Object Detection
  • 合作机构:中国科学技术大学、华为技术有限公司、清华大学、合肥综合性国家科学中心人工智能研究院
  • 论文状态:ECCV 2026,Oral(Spotlight)
  • 论文链接:https://arxiv.org/abs/2603.09411
  • 项目主页:https://github.com/RicePasteM/RiO-DETR

从水平框到旋转框,难点不只是 “多一个角度”

标准 DETR 一般通过中心点坐标、宽、高表征边界框,再由解码器逐层迭代优化预测结果。直观来看,只需额外增加一个角度预测参数,就能将水平框方案拓展为旋转框检测。但现有研究表明,这一改动本质上对应着完全不同的优化问题。

水平目标检测里,中心坐标与宽高参数定义在连续欧氏空间:检测框位置偏左便向右调整,尺寸偏大则向内收缩,参数的更新方向清晰直观。旋转框却面临多重难点:角度具备周期性,同一个矩形还能通过互换宽高产生多组等价参数表达;特别是处于周期临界点附近时,两组数值差异巨大的角度,对应的几何框却几乎完全重合。

除此之外,目标朝向无法单纯依靠框体位置与尺寸推断。飞机机头朝向、舰船航向、车辆行进方向,都需要依托目标纹理、部件结构乃至语义上下文综合判断。倘若模型将角度视作和中心坐标、宽高同类的位置参数,训练初期不准确的角度预测,极易干扰注意力模块的采样区域,造成训练偏差。

过去很多基于 DETR 改造的旋转检测方法,为提升精度堆叠了复杂度较高的注意力机制与特征采样模块,推理速度始终难以追上 YOLO、RTMDet 等 CNN 实时检测器。而 RiO-DETR 选择另一条路径:首先基于 RT-DETRv2 构建高性能旋转检测基线,引入 D-FINE 的通用匹配策略与 DEIM 的 Dense O2O 训练范式,随后围绕旋转检测独有的三大底层痛点,对网络结构开展系统性针对性优化。

挑战一,语义与几何耦合:位置和尺寸主要由几何关系决定,角度却常常需要结合纹理方向、物体朝向和部件布局判断。把角度硬塞进位置查询,可能在训练早期引入噪声。

挑战二,角度不是普通数轴:在周期空间里,接近 0 度和接近 180 度的两个方向,几何上可能非常接近,数值上却相距很远。普通加法更新和 L1 损失会在周期边界处给出错误的优化方向。

挑战三,搜索空间扩大:旋转框增加了自由度,二分图匹配与角度预测收敛更慢;水平检测里常见的密集监督,也未必能提供足够的角度多样性。

RiO-DETR 的三项核心设计,正好逐一对应这三个问题。



RiO-DETR 总体架构:内容驱动角度估计、旋转校正正交注意力与解耦周期细化。图片来源:论文 Figure 2

角度要“看内容”,而不是写死在位置里

现有多数旋转 DETR 方案,会将中心点、宽高与角度共五个参数一并编码至位置查询。该方式暗含一个前提假设:这几组参数属于同一类几何信息。但角度具备显著特殊性 —— 中心坐标与框尺寸回答的是 “目标位于何处、范围多大”,而角度刻画的是 “目标朝向”,二者承载的信息本质并不相同。

以遥感影像中的舰船为例:狭长目标的轮廓虽然能够体现主轴走向,却无法区分船头与船尾;而储罐、运动场、近方形建筑这类目标,还会因宽高互换产生多组等价旋转框参数。这类场景下,能够判别真实朝向的依据,不再单纯依靠坐标数值,而是物体轮廓、纹理走向、构件排布等视觉内容线索。

基于这一观察,RiO-DETR 提出内容驱动角度估计(Content-Driven Angle Estimation)机制:位置查询仅负责编码中心坐标与宽高信息,将角度从刚性几何先验中解耦剥离,交由独立的内容查询,依托图像特征自主学习预测。

对应论文公式:式 (1) 仅利用中心坐标与宽高构建位置查询;式 (2) 将注意力头进行划分,分别用于目标主方向及其正交方向的预测。



消融实验结果印证了上述思路。在 DIOR-R 数据集上,仅对中心坐标进行编码时模型 AP50 为 72.56;若将角度一并纳入位置编码,精度反而回落至 72.34;仅编码中心坐标与尺寸、剔除角度编码时,AP50 能够提升至 73.81。这说明,并不是向查询中塞入越多几何参数效果就越好,核心在于让角度依靠恰当的视觉线索推导得到。

不过仅仅将角度从位置查询中分离尚且不足。旋转目标往往同时存在纵向与横向结构,倘若所有注意力头都沿着目标主轴进行特征采样,模型极易过度关注目标长度特征,忽视宽度维度信息。为此本文提出Rotation-Rectified Orthogonal Attention(旋转校正正交注意力):将注意力头均分,一半沿预测目标角度执行采样,另一半沿该角度的正交方向采样。

采用 4:4 的均衡划分方式,既不引入额外参数,也不会增加计算量(FLOPs),相比 8 个注意力头全部沿单一方向采样的基线,将 AP50 由 73.81 提升至 74.18。该机制促使模型同步捕获目标主轴与侧向边界特征,防止注意力表征在单一方向发生坍缩。

针对旋转目标的自适应采样流程如公式所示:式 (3) 依据目标尺度对学习得到的采样偏移进行缩放;随后借助式 (4) 的旋转矩阵,将采样坐标系对齐至目标朝向。



下方可视化结果能够更加直观地展现该机制的作用:两组采样点并未在目标中心附近无序散布,而是分别沿着目标纵向、横向结构进行覆盖。针对舰船、桥梁、跑道这类长宽比例悬殊的目标,这种正交采样视角可以有效补齐单一主轴采样容易丢失的边缘特征;与此同时,该方案无需引入额外庞大的特征提取模块,不会带来显著的计算开销。



正交注意力在 DOTA 场景中的采样点:两组注意力头分别覆盖目标的主轴与正交方向。图片来源:论文 Figure 4

角度生活在圆上,优化也要走“最短路”

角度预测的核心难点,在于角度固有的周期边界歧义问题。当目标真实朝向接近 180 度、而模型预测结果趋近 0 度时,二者在视觉上几乎完全重合,但标准 L1 损失会判定两者误差极大,引导模型沿着错误的大幅偏差方向迭代修正。

这一问题可以用时钟逻辑通俗理解:11 点 59 分与 0 点 01 分在数值上处于刻度两端,实际时间间隔却仅有两分钟。若直接采用欧式直线距离计算损失、迭代优化,在角度周期边界附近,梯度反而会持续误导模型参数更新,造成角度预测抖动、来回跳变、无法收敛的问题。

与此同时,DETR 解码器采用多层迭代细化的预测机制,并非一次性输出最终检测结果。这就导致网络浅层产生的微小角度偏差,会在后续逐层的迭代优化中不断累积放大,最终造成整体旋转预测的不稳定。针对这一痛点,RiO-DETR 没有局限于优化最终输出的损失函数,而是对网络每一层的角度更新逻辑都进行了系统性重构,从全程解决角度预测偏差累积的问题。

RiO-DETR 提出Decoupled Periodic Refinement(解耦周期细化),同时改写更新规则和损失函数:

第一步,有界、由粗到细地更新角度:早期解码层允许较大幅度地修正朝向,后期逐层缩小更新范围,用更细的步幅对齐边界。

第二步,进行周期归一化:每次更新后都把角度映射回规范区间,避免角度值在边界外漂移。

由粗到细的周期更新:式(5)控制各解码层的步长衰减,式(6)限制单层角度改变量,式(7)再把结果映射回规范角度区间。



第三步,使用最短路径周期 L1 损失:不再比较数轴上的直接距离,而是比较圆周上的最短角距离,让梯度始终指向更近的方向。

最短路径损失:式(8)在直接角度差与跨越周期边界的距离之间取较小值,让梯度始终沿圆周上的短路径移动。



这不是在损失函数上打一个补丁,而是让 DETR 的角度细化过程与旋转几何本身保持一致。实验中,只用周期更新或只用最短路径损失都不稳定;两者配合,AP50 从 74.18 提升到 74.74。



左:周期细化让角度梯度沿圆周最短路径流动;右:Oriented Dense O2O 在单张训练图中注入多方向目标。图片来源:论文 Figure 3

让一张训练图同时拥有四种朝向

收敛速度缓慢,是旋转检测任务的另一大瓶颈。水平框检测仅需完成目标位置与尺度的匹配,而旋转检测需要额外遍历目标朝向,大幅扩大了二分图匹配的候选搜索空间。不仅如此,即便单张图像内包含大量目标,若多数目标的朝向趋于一致,角度分支能够获取的有效监督信号依然十分稀疏,严重拖累模型收敛效率。

常规 Dense O2O 的核心思路是将四张图像拼接为一张大图,在单次训练迭代中提升批次内的目标数量,以此强化模型学习效果。但 RiO-DETR 通过实验验证,单纯增加目标数量远远不够,旋转检测的训练核心,在于让模型同时接触丰富多样的目标朝向。基于此,本文对原有策略进行改进:在图像拼接前,对四张待拼接图像分别执行独立旋转变换,再整合为一张高密度训练图像。

具体而言,每一张子图都会从 0°、90°、180°、270° 四个角度中随机独立选择一个朝向完成旋转。该方式既能高效覆盖各类差异化目标朝向,丰富角度监督信号,又能避免对近正方形目标产生大量等价参数噪声,干扰模型学习。同一训练批次内,模型需要同时处理多朝向目标,让角度分支的学习更快趋于稳定。

本文提出的 Oriented Dense O2O 策略,无需增加推理开销,也几乎不会提升训练阶段的计算量,仅通过优化批次内的角度分布多样性,就能推动角度分支更早完成特征细化、收敛至稳定状态。

相关实验数据充分验证了该策略的有效性:在模型第一阶段训练中,无数据增强的基线方法需要 94 个 epoch 达到最优 AP50,常规增强方案需要 86 个 epoch,原版 Dense O2O 缩短至 68 个 epoch,而 Oriented Dense O2O 仅需 60 个 epoch,且能达到 73.88 的更高 AP50 精度。由此可见,高效收敛的关键不在于无差别增加旋转变换的数量,而在于将角度多样性深度融入密集一对一的监督学习过程。

实验结果:从 2.7 ms 到 29.9 ms,

整条模型族都留在实时区间

本文在 DOTA-1.0、DIOR-R、FAIR-1M-2.0 三大主流旋转检测基准数据集上完成全面评测。所有推理延迟均基于单张 NVIDIA T4 显卡、TensorRT 10 框架及 FP16 精度条件下统一测试。其中,本文端到端模型统计的延迟不含图像预处理与后处理环节,其余对比模型则通过 BatchedNMSPlugin 统计含 NMS 的实际工程推理延迟,贴合真实落地场景。

从完整模型家族的实时性能来看,RiO-DETR 覆盖 n、s、m、l、x 五种不同参数量化规格,在 DOTA-1.0 单尺度测试设置下,推理延迟分别为 2.7 ms、5.2 ms、8.8 ms、13.4 ms 和 29.9 ms,与同级别 YOLO26 系列模型的速度表现基本持平。这一结果证明,RiO-DETR 的实时推理优势并非轻量化模型的特例,而是贯穿轻量、中等、高精度全档位模型的通用性能。

对应的模型梯队也可适配不同实际任务需求,实现精度与体量的灵活权衡。面向边缘终端部署场景,参数量仅 4.0M 的 RiO-DETR-n 可满足轻量化、低延迟的检测需求;针对高精度遥感解析、精细目标检测任务,RiO-DETR-l 与 RiO-DETR-x 则能提供更优异的检测精度。整体速度–精度曲线始终处于当前方法的前沿水平,相较于单一展示最优精度指标,完整的模型梯队性能更能体现该方法的工程落地价值与泛用性。

DOTA-1.0 单尺度主性能表:表中同时列出非实时 CNN、非实时 DETR、实时检测器及 RiO-DETR 全系列;粗体为论文强调的关键结果。



DOTA-1.0 单尺度训练与测试下的主性能对比。来源:论文 Table 1

在 DOTA-1.0 单尺度设置下,RiO-DETR-x 的 81.8 AP50 高于相近延迟的 YOLO26x-obb(80.4 AP50,30.5 ms),也高于更慢的 RHINO-DETR(79.4 AP50,57.0 ms)。轻量端的 RiO-DETR-n 则以 2.7 ms 达到 78.4 AP50。



DIOR-R 与 FAIR-1M-2.0 单尺度训练与测试下的主性能对比。来源:论文 Table 3、Table 4

在 DIOR-R 上,RiO-DETR-x 以 17.31 ms 达到 77.43 AP50,相比 YOLO26x-obb 的 76.48 AP50、17.66 ms,在相近速度下继续保持精度优势。到了超过 100 万实例的 FAIR-1M-2.0,RiO-DETR-x 在多尺度设置下达到 47.4 AP50,超过论文列出的 YOLO26x-obb、LSKNet-S 和 ReDet。

完整的路线消融也很清晰。作者先构建了一个 73.47 AP50 的强基线;加入几何解耦查询编码后升至 74.18,说明把角度从位置先验中拿掉本身就能改善优化;再加入正交注意力后达到 74.74,证明纵向与横向信息确实互补。

在此基础上,周期细化和 Oriented Dense O2O 继续把结果推至 75.73 AP50。整个过程中,参数量、FLOPs 和延迟几乎不变。也就是说,这些增益主要不是来自更大的骨干网络或更高的计算预算,而是来自对角度表示、角度更新和角度监督方式的重新设计。

这一点与最终的速度对比相互印证:RiO-DETR 的目标不是用更重的结构换取少量精度,而是在保持实时基线轻量特性的前提下,逐项消除旋转 DETR 独有的性能损失。

真正的突破,不是让 DETR “也会画旋转框”

RiO-DETR 真正的价值,不在于多挤出了几个点的 AP,而在于它为旋转检测任务梳理出了一套清晰的设计思路:

  • 语义上,角度由物体自身的视觉内容和朝向线索决定,不能把它当成普通坐标来对待;
  • 几何上,角度活在周期空间里,更新和损失计算都得尊重圆周拓扑;
  • 监督上,旋转检测需要显式引入角度多样性,不能照搬水平检测的数据增广套路。

这三点归结起来,其实就是一个判断:想让 Transformer 在旋转检测上真正跑进实时区间,关键不是堆叠更重的模块,而是把旋转任务特有的几何约束,写进表示、注意力、细化和监督的每一个核心环节。

从应用视角看,这种速度与精度的平衡,直接关系到卫星遥感、无人机巡检、港口监测、交通感知和场景文字识别等需要处理任意朝向目标的场景。高分辨率图像里往往挤满了密集的小目标,检测器不仅要看得准,还得在有限的显存和时延预算下持续运转。

RiO-DETR 的另一层工程意义,在于它保留了 DETR 端到端、无需 NMS 的基本路线。传统密集检测器通常还要依赖阈值和后处理去除重复框,在类别多、目标密集的场景中会增加部署复杂度;端到端预测则让训练目标和最终输出更直接地对应起来。论文里的延迟数据是在 NVIDIA T4、TensorRT 10、FP16 下测的,在统一评测协议下,RiO-DETR 证明了一件事:Transformer 不必天然以高延迟为代价,也可以在与 YOLO 系列模型接近的速度区间内建立竞争力。

总结

RiO-DETR 把旋转目标检测中最棘手的三个问题拆开处理:用内容驱动角度估计解决语义与几何耦合,用解耦周期细化解决角度边界处的错误梯度,用 Oriented Dense O2O 加速扩展搜索空间中的角度收敛。

最终,它在 DOTA-1.0 上以 2.7 ms / 78.4 AP50 覆盖轻量端,以 29.9 ms / 81.8 AP50 覆盖高精度端,并在 DIOR-R 与 FAIR-1M-2.0 上展示出一致的速度 - 精度优势。

更深一层看,这项工作的启示是:旋转检测不是水平检测后面多出来的一列角度值,而是一套不同的语义与几何问题。当模型真正尊重角度的来源、结构和训练规律,端到端与实时性才不再是二选一。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
四川业余跑步大神陈毛去世,年仅57岁满身腱子肉,死因曝光太可惜

四川业余跑步大神陈毛去世,年仅57岁满身腱子肉,死因曝光太可惜

梦想总会变成真
2026-08-15 17:51:48
八国联军中,有七国已主动退还赔款,唯独一国分文不退,是谁?

八国联军中,有七国已主动退还赔款,唯独一国分文不退,是谁?

赫埰足球解说
2026-08-12 23:17:46
“穷加上美貌,就是灾难”,农村小学女生相貌惊艳,网友却不看好

“穷加上美貌,就是灾难”,农村小学女生相貌惊艳,网友却不看好

泽泽先生
2026-08-13 14:41:42
官宣,解放军无人机空运现金:金条、美元、新台币都有,不送弹药送钱干嘛?

官宣,解放军无人机空运现金:金条、美元、新台币都有,不送弹药送钱干嘛?

蓝星杂谈
2026-08-15 08:10:11
奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

轻扬墨雨
2026-08-14 13:21:23
终于知道为啥中国人没有蓄须的习惯了!评论区剖析一针见血,太精辟

终于知道为啥中国人没有蓄须的习惯了!评论区剖析一针见血,太精辟

夜深爱杂谈
2026-08-15 21:16:22
我国第一位美女宇航员刘洋,为何现在不见人影了?原因让国人泪目

我国第一位美女宇航员刘洋,为何现在不见人影了?原因让国人泪目

大鱼简科
2026-08-15 11:58:51
莎拉弹劾庭审大乱!法庭审判长出手了:检方已多次越过界线,必惩

莎拉弹劾庭审大乱!法庭审判长出手了:检方已多次越过界线,必惩

近史谈
2026-08-16 13:07:06
8月16日WTT瑞典大满贯半决赛+赛程+央视直播:王艺迪VS 张本美和,张本智和VS 松岛辉空

8月16日WTT瑞典大满贯半决赛+赛程+央视直播:王艺迪VS 张本美和,张本智和VS 松岛辉空

开成运动会
2026-08-16 07:21:45
晚年李讷透露:曾问父亲与谁关系最好?毛主席说出3个人的名字

晚年李讷透露:曾问父亲与谁关系最好?毛主席说出3个人的名字

凡人侃史
2026-08-15 13:51:58
刚夺冠又赢球!张帅2-1逆转创纪录,17万奖金到手,下轮复仇克星?

刚夺冠又赢球!张帅2-1逆转创纪录,17万奖金到手,下轮复仇克星?

刘姚尧的文字城堡
2026-08-16 08:37:36
烧烤店偶遇大胃王,满脸发黑看起来吓人,网友建议他去医院检查

烧烤店偶遇大胃王,满脸发黑看起来吓人,网友建议他去医院检查

映射生活的身影
2026-08-15 15:59:45
扎心!乌拉圭主帅谈复仇中国男篮:裁判的吹罚尺度比第一场更公正

扎心!乌拉圭主帅谈复仇中国男篮:裁判的吹罚尺度比第一场更公正

狼叔评论
2026-08-15 22:32:04
震惊!男生花7000元厚礼登门,女友回访却空手,女方母亲反倒指责男方看不起人

震惊!男生花7000元厚礼登门,女友回访却空手,女方母亲反倒指责男方看不起人

火山詩话
2026-08-14 13:59:17
王祖贤7年铁粉宣布脱粉!对女神心寒原因曝光,艾灸店也差评不断

王祖贤7年铁粉宣布脱粉!对女神心寒原因曝光,艾灸店也差评不断

萧狡科普解说
2026-08-14 03:55:59
最新:曝俄军被迫从第聂伯罗撤退!缺乏足够的预备兵力

最新:曝俄军被迫从第聂伯罗撤退!缺乏足够的预备兵力

项鹏飞
2026-08-15 21:26:36
文强被枪决16年后,他的儿子文伽昊沦为月薪3000的普通打工者,这样的结局令人感慨不已

文强被枪决16年后,他的儿子文伽昊沦为月薪3000的普通打工者,这样的结局令人感慨不已

人生录
2026-08-10 00:05:13
美国专家警告,只要中国打响武统第一枪,解决台湾问题只需96小时

美国专家警告,只要中国打响武统第一枪,解决台湾问题只需96小时

犟种美食
2026-08-15 16:13:53
太棒了!特斯拉宣布 Model Y 首次支持这个重要功能

太棒了!特斯拉宣布 Model Y 首次支持这个重要功能

XCiOS俱乐部
2026-08-15 19:44:05
曝苹果首款折叠屏手机iPhone Ultra9月8日发布,不与iPhone 18 Pro、iPhone 18 Pro Max同步上市

曝苹果首款折叠屏手机iPhone Ultra9月8日发布,不与iPhone 18 Pro、iPhone 18 Pro Max同步上市

鲁中晨报
2026-08-13 17:06:03
2026-08-16 15:12:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13770文章数 142718关注度
往期回顾 全部

科技要闻

210亿美元,黄仁勋投了马斯克

头条要闻

妻子产后抑郁自缢离世 岳父岳母两度起诉女婿争夺财产

头条要闻

妻子产后抑郁自缢离世 岳父岳母两度起诉女婿争夺财产

体育要闻

体系球员与体系本身

娱乐要闻

李小冉疑承认离婚 多次强调“一个人”

财经要闻

事关8万亿养老金!长周期考核落地中

汽车要闻

杨洋成001号车主 岚图追光S正式上市

态度原创

房产
旅游
健康
手机
公开课

房产要闻

金茂、招商,海南多个岗位招人!

旅游要闻

当嘉峪关遇见佩特拉

专家解答青少年脊柱侧弯七大问题

手机要闻

小米REDMI K100 Pro系列手机首销日成绩曝光,销量约上代的65%

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版