
YOLOMG: Vision-based Drone-to-Drone Detection with Appearance and Pixel-Level Motion Fusion原文地址 https://arxiv.org/abs/2503.07115GitHubhttps://github.com/Irisky123/YOLOMG.这篇文章思想非常好大道至简。工业界比较喜欢这样的方法边缘端NPU平台部署非常友好而且非常灵活可以和任意的检测模型相结合文中使用的运动对齐方法-稀疏光流cpu端也非常友好动静平台都很合适也非常适合复杂背景。而且融合一个新特征图的方法可以非常灵活本文是运动场景所以用到了motionmap, 如果是其他的任务map可以根据自己的业务需求进行拓展这个map是有一定的教师能力的。文中提到的算法缺点之一“依赖运动特征悬停或者低速无人机容易漏检后续网络需要同时兼顾静止与运动无人机”----其实作者可以补一组消融实验将掩膜置为0看看是否是这样。这个算法真正的缺点是弱小目标问题(只有2-3个像素)弱小目标很可能提取不出来掩膜至少在提取不出来掩膜的时候不要影响检测网络本身的能力也是可以的在具体的应用场景中还有很大的优化空间。摘要基于视觉的无人机对无人机检测在视觉集群飞行、空中感知规避、恶意无人机侦测等众多任务中有着重要价值受到越来越多的关注。但现有算法在背景复杂或者目标尺寸极小时经常出现检测失效。本文提出一种全新的端到端框架借助运动引导能够在复杂环境下精准识别小型无人机。该方法首先生成运动差异图捕捉微型无人机的运动特征随后通过双模态融合模块将运动差异图与 RGB 图像相结合实现针对无人机的自适应特征学习最后在 YOLOv5 框架基础上改造得到增强骨干网络与检测头对融合后的特征图进行处理输出高精度检测结果。*一、引言YOLO 系列、R‑CNN 系列、SSD、DETR 等经典目标检测网络已经被用于无人机检测 [5‑7]。当目标无人机轮廓清晰、在画面中占比较大、背景简单时这些方法可以取得不错效果。但在复杂场景下外观特征可靠性下降算法极易失效。如图 1 (a)背景环境极度复杂时目标无人机很容易淹没在背景当中如图 1 (b)距离相机约 100 米的无人机在 1920×1080 分辨率图像中仅占 10×10 像素。而绝大多数检测网络的下采样与池化操作会进一步加剧小目标检测的困难。因此亟需面向复杂恶劣条件开发高效无人机检测算法。图 1 无人机对无人机检测的各类难点示意图。(a)背景干扰无人机和背景难以区分(b) ARD100 数据集内目标尺寸极小(c)相机自身运动带来运动模糊。右侧图片放大 700% 便于观察已有部分研究将运动特征或者时序信息引入无人机检测任务例如背景差分 [8‑12]、时序信息 [13‑14]、光流法 [15‑17]。这类方法虽有一定效果但针对目标极小、融入城市背景的场景仍不够理想现存局限如下多数算法仅在 NPS‑Drones、FL‑Drones 数据集上完成测试在更具挑战性场景下的性能缺少充分验证当相机自身运动时微型无人机的运动特征很难和背景运动区分开现有算法对全新场景、新型无人机泛化能力不足而这是实际落地的关键不少方法计算开销过大难以部署在机载硬件平台。针对以上问题本文提出运动引导的目标检测器 YOLOMG用于极小无人机检测。首先设计运动特征增强模块提取微型无人机像素级运动特征通过双模态融合模块将运动差异图与 RGB 图像融合自适应学习无人机特征最后基于 YOLOv5 搭建轻量化增强骨干网络与检测头端到端输出检测结果。本文主要创新点总结构建全新空对空无人机检测数据集 ARD100。在现有同类数据集中该数据集视频数量最多目标平均尺寸最小约占画面 0.01%。数据集包含城市复杂背景、相机剧烈抖动、低光照、微型无人机等多种挑战助力无人机检测与跟踪方向研究。将像素级运动特征 —— 运动差异图与 RGB 图像结合实现极小目标检测。ARD100 数据集实验表明在高难度场景下本文算法平均精度 AP 相比现有最优算法提升 22%。提出一套高效端到端极小无人机检测框架在 NPS‑Drones 数据集取得当前最优性能模型推理效率高、泛化性能强在未参与训练的 Drone‑vs‑Bird 数据集以及低光照场景下各项指标均优于通用目标检测算法。二、相关工作2.2 小目标检测小目标检测一直是难点核心问题是目标外观、纹理信息匮乏。现有前沿算法常借助时序、运动特征增强小目标检测能力。文献 [22] 堆叠 5 帧灰度图像生成目标热力图使用由粗到细两阶段 CNN 完成检测文献 [16,23] 采用两阶段框架把图像切分为重叠图像块尽可能保留小目标外观文献 [24] 基于 YOLOv5 搭建时空深度学习模型利用帧序列获取时序上下文文献 [25] 依靠空中目标与背景运动不一致的线索定位潜在目标文献 [26] 提出自重建机制借助差异图增强小目标微弱特征。上述方法在部分小目标场景有效但尚未在相机存在显著自身运动的无人机对无人机检测任务中得到验证。*三、本文所提方法YOLOMG 整体网络结构见图 2主要由运动特征增强模块 (MFEM)、双模态融合模块 (BFM)两部分组成。图 2 YOLOMG 算法整体架构。首先运动特征增强模块提取无人机运动差异图双模态融合模块自适应融合 RGB 特征与运动特征融合特征送入轻量化 YOLO 骨干网络提取深层特征经过特征金字塔 FPN 跨层融合最后送入检测头输出检测结果。3.1 运动特征增强模块 (MFEM)部分现有工作使用光流提取无人机运动特征 [16‑17,27]但是当目标极小、背景复杂时缺少显著特征点光流容易失效同时稠密光流网络计算开销大不适合移动平台。受微型目标检测 [10,26]、视频动作识别 [28‑29] 启发本文使用像素级差异图构建无人机运动特征。帧差分法 [30‑31] 是简单有效的运动目标检测技术利用相邻帧像素变化捕捉运动物体。在时间间隔很短前提下像素变化大多来自运动物体。参考已有工作 [8,32‑33]本文先通过图像对齐完成帧稳定再使用改进三帧差分法突出运动目标。3.2 双模态融合模块 (BFM)1融合策略运动差异图可以给出目标位置引导但很容易受到干扰行驶车辆、行人、飞鸟还有图像对齐错误都会产生伪运动信号。虽然这些干扰物在运动差异图上和无人机十分相似但是它们在 RGB 图像上外观特征差异明显。因此可以利用 RGB 的外观特征区分无人机与干扰。借鉴多模态融合检测思路 [30,35‑37]将运动差异图与 RGB 图像视为无人机的两种模态。为保持模型轻量化采用特征级融合策略。RGB 图像与运动差异图输入双模态融合模块得到融合特征图再送入骨干网络下采样经过 FPN 跨层融合最后输入检测头输出检测结果。2网络结构YOLOMG 一共 35 层网络整体下采样倍率为 16 倍。骨干网络在 YOLOv5s 基础上扩展改造减少通道数提升推理速度。 针对小目标检测在 Neck 部分增加小目标检测层将最后一层特征图上采样与骨干网络对应分辨率特征图拼接后送入检测头最终拥有 4 个检测分支。FPN 在上采样过程融合深浅层特征生成高分辨率、强语义特征图。对比原始 YOLOv5s本文网络更加轻量化专门针对小目标检测做优化。3双模态自适应融合普通卷积前向传播时所有特征权重均等。但双模态输入场景中经常出现某一模态质量高、另一模态质量差的情况。例如背景极度复杂时RGB 图像很难区分无人机而运动差异图仍然可以提供清晰运动信息。本文采用与文献 [35‑36] 类似的自适应融合策略由自适应权重块、通道‑空间注意力模块 CBAM 两部分构成见图 2 右下角。RGB 特征图与运动特征图先经过自适应权重块生成初始权重与混合特征图混合特征送入 CBAM 卷积块注意力模块生成通道权重输出最终融合特征图。借助 CBAM网络可以自动给质量更高的输入特征分配更大权重。四、实验4.1 数据集本文在自建 ARD100 数据集与公开 NPS‑Drones 数据集上开展算法评估。ARD100 数据集一共 100 段视频总计 202467 帧使用大疆 Mavic2、M300 相机在中低空采集。数据集包含大量真实场景挑战复杂背景、强光弱光、相机剧烈抖动、无人机高速飞行、目标尺寸极小。视频帧率 30FPS分辨率 1920×1080。 划分65 段视频作为训练集35 段视频作为测试集测试集包含训练集未出现的场景、弱光强光片段验证模型泛化能力与鲁棒性。该数据集中大量目标尺寸小于 12×12 像素在现有无人机对无人机检测数据集当中视频数量最多目标平均尺寸最小。NPS‑Drones 数据集 [8]50 段定制三角翼无人机视频合计 70250 帧机载 GoPro3 相机拍摄分辨率 1920×1280 或 1280×960。目标尺寸分布 10×8 ~ 65×21 像素目标平均占画面 0.05%。本文使用文献 [16] 发布的干净标注按照文献 [16] 划分方式前 40 段视频用于训练验证剩余 10 段做测试。4.2 评价指标与实验设置1评价指标遵循相关工作 [14,16]采用精确率 Precision、召回率 Recall、平均精度 APIOU 阈值设置为 0.5预测框与真值框 IOU≥0.5 记为真正例单 GPU 下每秒帧数 FPS 衡量推理速度。2实现细节实验硬件为 NVIDIA RTX 2080Ti优化器 Adam动量 0.937初始学习率 0.01训练轮数 100 epochbatch size8使用 MS COCO 预训练 YOLOv5s 权重初始化。4.3 对比现有 SOTA 算法对比算法包含单阶段检测器、两阶段检测器、视频目标检测算法、小目标检测专用算法 [14,16,23]。为尽可能保留小目标外观特征大部分对比算法训练测试输入尺寸 1280×1280。CFINet、Dogfight 训练时图像分别切分为 3×2、3×3 重叠图像块。所有对比方法均使用官方公开代码加载公开预训练权重微调。ARD100 数据集定量结果如表 2。本文算法各项指标均优于现有方法ARD100 上 AP 相较最优对比算法提升 21 个百分点。值得注意YOLOMG 输入尺寸仅 640×640性能已经超过全部输入 1280×1280 的对比算法640 输入推理速度和 YOLOv5 接近具备机载部署潜力。对比基线 YOLOv5s 可以看出引入运动特征显著提升小目标检测能力。YOLOMG 具备即插即用特性可以适配后续 YOLO 系列新版本。在 NPS‑Drones 数据集上YOLOMG 取得与当前最优算法持平的最高 AP。可视化对比见图 6。在复杂背景、目标极小时对比算法漏检或者输出不准确边界框YOLOMG 可以实现精准检测。更多测试结果见补充视频。4.4 消融实验运动差异图消融在 ARD100输入 640×640上测试不同差分方式、帧间隔 k。三帧差分优于两帧差分k2 效果优于 k1但是帧间隔进一步增大精度反而下降。原因更大帧间隔会放大运动特征但同时引入更多噪声。只用两张 RGB 图作为输入对比实验可以看出运动差异图能够大幅提升小目标检测性能。这里可以补充一组掩膜全0的效果就可以看出来本文方法到底适不适合静平台或静目标。NPS‑Drones 数据集输入 1280也得到同样结论三帧差分效果优于两帧差分步长为 2 最优步长继续增加性能回落。小目标检测层消融去掉小目标检测层ARD100 数据集 AP 下降 2 个百分点证明该模块有效。泛化性测试使用 ARD100 训练好的模型直接在 Drone‑vs‑Bird 数据集测试无人机种类、场景均未见过另外训练集剔除夜间低光样本在夜间数据上测试低光照泛化性能。结果见表 5YOLOMG 的召回率与整体 AP 明显优于通用检测器。失败案例分析本算法依靠运动特征做引导悬停、低速运动无人机偶尔漏检极小目标外观信息极少部分和远距离无人机外观相似的物体会产生误检。五、讨论本文借助运动特征解决复杂背景下极小无人机检测问题性能与泛化能力优于现有 SOTA。原因主要两点运动差异图专门提取无人机运动特征当目标极小、背景复杂时补充大量有效信息仅依靠外观的检测器在此条件下表现很差。其他引入运动信息的方法针对极小目标提取的运动、时序特征不足。运动差异图不依赖目标类别在不同无人机、不同环境下具备域不变特性泛化能力优于纯外观的通用检测器。同时算法仍存在局限未来有待改进依赖运动特征悬停或者低速无人机容易漏检后续网络需要同时兼顾静止与运动无人机引入运动差异图带来额外计算开销需要进一步优化计算效率。————————————————版权声明本文为CSDN博主「Eva_Hua」的原创文章遵循CC 4.0 BY-SA版权协议转载请附上原文出处链接及本声明。原文链接https://blog.csdn.net/whatwho_518/article/details/160376341