LRSAA: Large-Scale Remote Sensing Image Target Recognition and Automatic Annotation
摘要 Abstract
Index Terms: remote sensing, target recognition, machine learning, automatic annotation, poisson disk.
方法 四阶段框架
LRSAA 的方法论可概括为四个阶段:先对大图做泊松盘采样分割,再在子图上训练双检测模型,将结果映射回原图以保持空间一致性,最后以合成数据增强原数据集并再训练,形成持续迭代的闭环。
泊松盘采样分割
利用泊松盘采样与分割技术,将大范围遥感影像切分为若干较小的子图,使样本点在空间中均匀铺开(任意两点间距不小于半径 r),兼顾覆盖与重叠控制。
双模型训练(YOLOv11 + MobileNetV3-SSD)
在切分后的子图上分别训练 YOLOv11 与 MobileNetV3-SSD 检测模型,二者在不同尺度与场景下各有优势,为后续集成提供互补的输出。
结果映射回原图
将各子图的检测结果映射回原始大图,保持空间一致性,得到与整图坐标系对齐的完整标注。
合成数据增强与再训练
将本流程生成的合成数据按一定比例混入原数据集,扩充训练样本(含成比例的合成样本),对模型再训练,使其在多样场景下持续自适应提升。
泊松盘采样 Poisson Disk Sampling
泊松盘采样是一种先进的采样方法,能在空间中生成彼此间距均匀、任意两点至少相距指定半径 r 的样本点,广泛用于纹理生成、物体分布、重采样与渲染等任务(Bridson, 2007)。
EIoU 度量与 NMS
我们采用增强交并比(EIoU)优化边界框预测,通过引入几何信息弥补传统 IoU 的不足。EIoU 损失函数定义如下:
其中 ρ² 表征中心点距离损失,v 表征宽高比损失。结合 EIoU-NMS 进行后处理,在推理阶段进一步提升定位精度与框质量。
实验与结果 Experiments
实验基于大规模俯视影像数据集 XView,并自建覆盖天津、上海、厦门三市的高分辨率遥感数据集(0.6m 分辨率,每城取 20 个 6400×6400 像素标注区域)。考虑到检测性能随裁剪尺度变化,采用 320×320、640×640、1280×1280 三种标准尺度评测鲁棒性,并以 IoU > 0.5 判定命中,采用 Accuracy、Precision、Recall、F1 与 mAP 作为指标。
主对比(640-cut,各城市平均)
| 模型 | Accuracy | F1 | mAP |
|---|---|---|---|
| RetinaNet | 0.602 | 0.640 | 0.53 |
| SSD VGG | 0.691 | 0.521 | 0.47 |
| Faster R-CNN | 0.559 | 0.592 | 0.49 |
| YOLOv11 | 0.676 | 0.683 | 0.56 |
| MobileNetV3-SSD | 0.666 | 0.668 | 0.63 |
| LRSAA (ours) · 640-cut | 0.791 | 0.777 | 0.70 |
| LRSAA (ours) · 320-cut | 0.763 | 0.746 | 0.72 |
LRSAA 在全部指标与三座城市上均优于对比模型,尤其在 640-cut 与 320-cut 下表现最佳;所有模型在切分小图后性能均显著提升,说明缩小图像尺寸对检测有利。
合成数据训练(Table II)
| 原始数据 : 合成数据 | Accuracy | F1 | mAP |
|---|---|---|---|
| 0% : 100% | 0.707 | 0.706 | 0.64 |
| 20% : 80% | 0.712 | 0.720 | 0.65 |
| 40% : 60% | 0.710 | 0.698 | 0.64 |
| 60% : 40% | 0.718 | 0.733 | 0.67 |
| 80% : 20% | 0.716 | 0.739 | 0.66 |
随合成数据比例增加,各项指标总体呈上升趋势,60% 合成数据配比取得最佳 mAP(0.67)与较高 F1,验证了合成数据对泛化与鲁棒性的增益。
结论与未来工作 Conclusion
本文提出 LRSAA——一个面向大范围遥感影像目标识别与自动标注的新框架。它通过集成学习融合 YOLOv11 与 MobileNetV3-SSD,并结合泊松盘采样分割与 EIoU-NMS 优化训练与推理,在精度与速度间取得良好平衡,同时降低计算开销。
基于 XView 训练并在天津、上海、厦门遥感影像上测试,LRSAA 在多项指标上持续领先;合成数据训练显著提升了识别能力。该工作推进了遥感影像分析,提升了地理信息获取与利用效率。
未来工作:引入更先进的深度学习架构(如基于 Transformer 的模型)以进一步提升精度与效率;评估 LRSAA 在边缘设备、云环境等多种硬件平台上的计算效率与可扩展性。