董梧铮
论文详情 · IEEE ICGMRS 2025

LRSAA: Large-Scale Remote Sensing Image Target Recognition and Automatic Annotation

Wuzheng Dong (董梧铮), Yujuan Zhu, Sheng Zhang
董梧铮为该论文第一作者,作者单位:南开大学数学科学学院(School of Mathematical Sciences, Nankai University)。
2025 6th International Conference on Geology, Mapping and Remote Sensing (ICGMRS) · IEEE · DOI: 10.1109/ICGMRS66001.2025.11065897
通讯邮箱:aerovane@mail.nankai.edu.cn
0.70
平均 mAP(LRSAA 640-cut)
0.791
平均 Accuracy
2
集成检测模型(YOLOv11 + MobileNetV3-SSD)
3
验证城市(天津·上海·厦门)

摘要 Abstract

This paper introduces a novel method for object recognition and automatic labeling in large-area remote sensing images, called LRSAA. The proposed method integrates the YOLOv11 and MobileNetV3-SSD object detection algorithms through ensemble learning to enhance overall model performance. Additionally, it utilizes Poisson disk sampling segmentation techniques along with the EIoU metric to optimize both the training and inference processes of segmented images, culminating in an integrated results framework. This approach not only minimizes computational resource requirements but also achieves an effective balance between accuracy and processing speed. The source code for this project is publicly accessible at https://github.com/anaerovane/LRSAA.
中文概述:本文提出一种面向大范围遥感影像的目标识别与自动标注新方法 LRSAA。该方法通过集成学习融合 YOLOv11 与 MobileNetV3-SSD 两类目标检测算法以提升整体性能,并引入泊松盘采样分割技术与 EIoU 度量来优化分割影像的训练与推理流程,最终形成一体化的结果框架。该方法在显著降低计算资源需求的同时,实现了精度与处理速度的有效平衡。项目源码已开源于 GitHub。

Index Terms: remote sensing, target recognition, machine learning, automatic annotation, poisson disk.

方法 四阶段框架

LRSAA 的方法论可概括为四个阶段:先对大图做泊松盘采样分割,再在子图上训练双检测模型,将结果映射回原图以保持空间一致性,最后以合成数据增强原数据集并再训练,形成持续迭代的闭环。

A

泊松盘采样分割

利用泊松盘采样与分割技术,将大范围遥感影像切分为若干较小的子图,使样本点在空间中均匀铺开(任意两点间距不小于半径 r),兼顾覆盖与重叠控制。

B

双模型训练(YOLOv11 + MobileNetV3-SSD)

在切分后的子图上分别训练 YOLOv11 与 MobileNetV3-SSD 检测模型,二者在不同尺度与场景下各有优势,为后续集成提供互补的输出。

C

结果映射回原图

将各子图的检测结果映射回原始大图,保持空间一致性,得到与整图坐标系对齐的完整标注。

D

合成数据增强与再训练

将本流程生成的合成数据按一定比例混入原数据集,扩充训练样本(含成比例的合成样本),对模型再训练,使其在多样场景下持续自适应提升。

泊松盘采样 Poisson Disk Sampling

泊松盘采样是一种先进的采样方法,能在空间中生成彼此间距均匀、任意两点至少相距指定半径 r 的样本点,广泛用于纹理生成、物体分布、重采样与渲染等任务(Bridson, 2007)。

EIoU 度量与 NMS

我们采用增强交并比(EIoU)优化边界框预测,通过引入几何信息弥补传统 IoU 的不足。EIoU 损失函数定义如下:

EIoU = 1 − IoU + ρ² + v

其中 ρ² 表征中心点距离损失,v 表征宽高比损失。结合 EIoU-NMS 进行后处理,在推理阶段进一步提升定位精度与框质量。

泊松盘采样示意
Figure 3. 泊松盘采样示意:红点为由泊松盘方法生成的采样点,粉色框为基于采样点提取的区域。

实验与结果 Experiments

实验基于大规模俯视影像数据集 XView,并自建覆盖天津、上海、厦门三市的高分辨率遥感数据集(0.6m 分辨率,每城取 20 个 6400×6400 像素标注区域)。考虑到检测性能随裁剪尺度变化,采用 320×320、640×640、1280×1280 三种标准尺度评测鲁棒性,并以 IoU > 0.5 判定命中,采用 Accuracy、Precision、Recall、F1 与 mAP 作为指标。

主对比(640-cut,各城市平均)

模型AccuracyF1mAP
RetinaNet0.6020.6400.53
SSD VGG0.6910.5210.47
Faster R-CNN0.5590.5920.49
YOLOv110.6760.6830.56
MobileNetV3-SSD0.6660.6680.63
LRSAA (ours) · 640-cut0.7910.7770.70
LRSAA (ours) · 320-cut0.7630.7460.72

LRSAA 在全部指标与三座城市上均优于对比模型,尤其在 640-cut 与 320-cut 下表现最佳;所有模型在切分小图后性能均显著提升,说明缩小图像尺寸对检测有利。

合成数据训练(Table II)

原始数据 : 合成数据AccuracyF1mAP
0% : 100%0.7070.7060.64
20% : 80%0.7120.7200.65
40% : 60%0.7100.6980.64
60% : 40%0.7180.7330.67
80% : 20%0.7160.7390.66

随合成数据比例增加,各项指标总体呈上升趋势,60% 合成数据配比取得最佳 mAP(0.67)与较高 F1,验证了合成数据对泛化与鲁棒性的增益。

LRSAA 在城市遥感影像上的自动标注效果
Figure 1. LRSAA 的实际应用效果:在天津 0.6m 分辨率城市遥感影像上的详细自动标注结果示例。

结论与未来工作 Conclusion

本文提出 LRSAA——一个面向大范围遥感影像目标识别与自动标注的新框架。它通过集成学习融合 YOLOv11 与 MobileNetV3-SSD,并结合泊松盘采样分割EIoU-NMS 优化训练与推理,在精度与速度间取得良好平衡,同时降低计算开销。

基于 XView 训练并在天津、上海、厦门遥感影像上测试,LRSAA 在多项指标上持续领先;合成数据训练显著提升了识别能力。该工作推进了遥感影像分析,提升了地理信息获取与利用效率。

未来工作:引入更先进的深度学习架构(如基于 Transformer 的模型)以进一步提升精度与效率;评估 LRSAA 在边缘设备、云环境等多种硬件平台上的计算效率与可扩展性。