
简介这份资源是面向人工智能与计算机视觉方向研究者、学生及算法工程师的潜艇卫星图目标检测数据集可用于训练和验证水下目标识别模型服务于海洋监控、国防安全与环境监测等场景。压缩包共2001个文件包含1000张1024×1024像素的jpg卫星图像、1000个xml标注文件以及1个info.txt说明文档整体约345.83MB标注以边界框形式记录潜艇位置与类别可直接对接YOLO、Faster R-CNN等主流检测框架。info.txt提供数据集总体说明annotations存放每张图的坐标与类别信息images则保存原始卫星图像目录划分清晰便于按模块解析与加载。目前已有1686人学习下载适合需要快速搭建目标检测实验、验证算法精度与实时性的读者参考使用。1. 潜艇卫星图目标检测数据集从零训练一个能用的检测器潜艇卫星图目标检测数据集解决的是遥感场景下小目标、低对比度、复杂海况的检测问题。卫星图里的潜艇目标通常只有几十个像素背景是海面杂波、云层阴影和港口设施跟 COCO 里那些大目标完全不是一个难度。这个方向适合三类人做遥感目标检测的研究生、需要海上态势感知的工程团队、以及想拿一个真实小目标数据集练手的算法工程师。数据集本身通常包含光学卫星或 SAR 影像标注格式以水平框或旋转框为主类别一般只有“潜艇”或“舰船”一两类。难点不在模型结构而在数据预处理、小目标增强和评估指标的选择。下面按“数据集怎么读 → 模型怎么选 → 训练怎么调 → 坑在哪 → 怎么验证”的顺序拆开讲。2. 潜艇卫星图数据集的读取与格式转换从原始标注到 YOLO 可训练2.1 先搞清楚你的数据集是水平框还是旋转框拿到一个潜艇卫星图数据集第一件事不是写模型而是确认标注类型。常见的有三种PASCAL VOC 的 XML 水平框、COCO 的 JSON 水平框、DOTA 格式的旋转框。潜艇在卫星图里往往有明确朝向水平框会引入大量背景像素旋转框更合适。但旋转框训练需要 mmrotate 或 YOLOv8-OBB 这类框架不是所有团队都熟悉。我的建议是如果目标长宽比超过 3:1优先考虑旋转框如果只是做粗定位水平框也能跑出可用结果。判断方法很简单打开标注文件看坐标数量。VOC 的 bndbox 有四个值DOTA 的标注有八个值四个角点。下面是一个快速统计脚本import os import xml.etree.ElementTree as ET # 统计VOC格式标注中目标的长宽比分布 ratios [] for xml_file in os.listdir(annotations): if not xml_file.endswith(.xml): continue tree ET.parse(os.path.join(annotations, xml_file)) for obj in tree.findall(object): bbox obj.find(bndbox) w float(bbox.find(xmax).text) - float(bbox.find(xmin).text) h float(bbox.find(ymax).text) - float(bbox.find(ymin).text) if h 0: ratios.append(w / h) import numpy as np ratios np.array(ratios) print(f目标数量: {len(ratios)}) print(f长宽比中位数: {np.median(ratios):.2f}) print(f长宽比3的比例: {(ratios 3).mean():.2%})这段代码遍历所有 XML 文件提取每个目标框的宽高计算长宽比。如果中位数超过 3说明目标细长旋转框更合适。参数上annotations目录换成你的实际路径即可。注意有些数据集用xmin/ymin/xmax/ymax有些用xmin/ymin/width/height读之前先看一个文件确认字段名。2.2 转成 YOLO 格式四个边界坑YOLO 训练需要每张图对应一个 txt每行是class_id x_center y_center width height全部归一化到 0-1。转换脚本网上一搜一大把但潜艇卫星图有几个特殊坑第一图像尺寸不一致。卫星图可能是 1024×1024、512×512 甚至 2048×2048 混在一起。归一化时必须用每张图自己的宽高不能用一个全局尺寸。第二有些标注框超出图像边界。卫星图拼接时边缘目标会被裁切标注可能保留原始坐标导致 xmax 大于图像宽度。转换前要 clamp 到 [0, width]。第三类别名映射。如果数据集里写的是 “submarine” 和 “warship”你要决定是合并成一类还是保留两类。潜艇检测通常只关心潜艇建议合并成 “submarine” 一类减少类间混淆。第四空标注文件。有些图没有目标YOLO 需要对应的空 txt 文件否则训练时会报错。转换时记得为每张图都生成 txt哪怕内容是空的。import os import xml.etree.ElementTree as ET from PIL import Image def voc_to_yolo(xml_dir, img_dir, out_dir, class_map): os.makedirs(out_dir, exist_okTrue) for xml_file in os.listdir(xml_dir): if not xml_file.endswith(.xml): continue tree ET.parse(os.path.join(xml_dir, xml_file)) root tree.getroot() # 用对应的图像文件获取真实宽高 img_name os.path.splitext(xml_file)[0] .jpg img_path os.path.join(img_dir, img_name) if not os.path.exists(img_path): continue with Image.open(img_path) as im: W, H im.size lines [] for obj in root.findall(object): name obj.find(name).text if name not in class_map: continue cls_id class_map[name] bbox obj.find(bndbox) xmin max(0, float(bbox.find(xmin).text)) ymin max(0, float(bbox.find(ymin).text)) xmax min(W, float(bbox.find(xmax).text)) ymax min(H, float(bbox.find(ymax).text)) # 过滤掉无效框 if xmax xmin or ymax ymin: continue xc (xmin xmax) / 2 / W yc (ymin ymax) / 2 / H w (xmax - xmin) / W h (ymax - ymin) / H lines.append(f{cls_id} {xc:.6f} {yc:.6f} {w:.6f} {h:.6f}) out_path os.path.join(out_dir, os.path.splitext(xml_file)[0] .txt) with open(out_path, w) as f: f.write(\n.join(lines)) voc_to_yolo(annotations, images, labels, {submarine: 0})逻辑说明先读 XML再用 PIL 打开对应图像拿真实宽高然后对每个目标框做边界裁剪和归一化。class_map控制类别映射只保留需要的类别。参数上xml_dir、img_dir、out_dir按实际路径改。注意xmax和ymax要 clamp 到图像宽高否则归一化后坐标会大于 1YOLO 训练时直接报错。2.3 数据集划分别用随机划分遥感图像有个特点同一区域的多张图高度相似。如果随机划分训练集和验证集验证集里可能有跟训练集几乎一样的图指标虚高。正确做法是按区域或按时间划分。如果数据集本身按区域组织直接按区域分如果没有用图像的地理坐标做聚类同一簇的图分到同一侧。没有坐标信息时至少按文件名前缀分组别让同一批次的图跨集。import os import random from sklearn.cluster import KMeans import numpy as np # 假设文件名里包含经纬度或区域编号这里用文件名哈希模拟分组 files [f for f in os.listdir(images) if f.endswith(.jpg)] # 按前缀分组前缀相同的分到同一侧 groups {} for f in files: prefix f.split(_)[0] groups.setdefault(prefix, []).append(f) group_keys list(groups.keys()) random.shuffle(group_keys) split int(len(group_keys) * 0.8) train_groups group_keys[:split] val_groups group_keys[split:] with open(train.txt, w) as f: for g in train_groups: for img in groups[g]: f.write(fimages/{img}\n) with open(val.txt, w) as f: for g in val_groups: for img in groups[g]: f.write(fimages/{img}\n)这段代码按文件名前缀分组保证同一组的图不会同时出现在训练和验证集。参数上0.8是训练集比例按需调整。如果你的数据集有地理坐标把prefix换成坐标聚类结果更好。3. 模型选型与训练参数YOLOv8 还是旋转框检测器3.1 水平框场景YOLOv8 够用但要注意输入分辨率潜艇卫星图目标小YOLOv8 默认 640 输入下一个 30 像素的目标缩到 640 后只剩不到 20 像素特征图上的响应很弱。常见做法是把输入提到 1024 或 1280但显存占用会翻倍。我的经验是先试 1024如果 mAP 不够再上 1280同时把 batch size 降到 4 或 2。YOLOv8 的imgsz参数直接控制输入尺寸训练命令如下yolo detect train \ datasubmarine.yaml \ modelyolov8s.pt \ imgsz1024 \ epochs200 \ batch4 \ patience30 \ lr00.01 \ lrf0.01 \ mosaic0.5 \ scale0.3 \ degrees0.0 \ translate0.1 \ fliplr0.5 \ flipud0.5 \ device0参数说明imgsz1024是输入分辨率小目标场景别低于 1024。batch4是显存不够时的妥协显存够可以上 8。mosaic0.5控制 mosaic 增强概率小目标场景建议降到 0.5 以下因为 mosaic 会把四张图拼一起目标更小。scale0.3是缩放增强幅度别太大否则小目标直接消失。flipud0.5是上下翻转卫星图没有方向性上下翻转合理。degrees0.0关闭旋转水平框场景旋转会引入无效框。3.2 旋转框场景mmrotate 或 YOLOv8-OBB如果目标长宽比大水平框漏检严重就得上旋转框。mmrotate 是 OpenMMLab 的旋转框检测工具箱支持 DOTA 格式。YOLOv8-OBB 是 Ultralytics 的旋转框版本上手更快。两者选型看团队熟悉度mmrotate 配置灵活但学习曲线陡YOLOv8-OBB 开箱即用但自定义受限。mmrotate 训练配置的核心参数在configs/_base_/datasets/dota.py里主要改img_scale、keep_ratio和classes。潜艇数据类别少把num_classes改成 1 或 2。训练命令python tools/train.py \ configs/rotated_retinanet/rotated-retinanet-rbox-le90_r50_fpn_1x_dota.py \ --work-dir work_dirs/submarine \ --cfg-options data.train.dataset.classes(submarine,) \ data.val.dataset.classes(submarine,) \ model.bbox_head.num_classes1参数说明--cfg-options直接覆盖配置里的类别数和类别名。work-dir是输出目录。注意 mmrotate 的 DOTA 格式标注需要images和labelTxt两个目录labelTxt里每行是x1 y1 x2 y2 x3 y3 x4 y4 class_name difficult。3.3 小目标增强三个真正有用的技巧第一个切图训练。把 1024×1024 的图切成 512×512 带重叠目标相对变大。推理时再拼回去。切图重叠率设 0.2太小会漏掉边缘目标太大浪费算力。第二个复制粘贴增强。把训练集里的潜艇目标抠出来随机贴到其他海面背景上。这个对小目标提升明显但要注意粘贴位置别太离谱别贴到陆地上。第三个负样本挖掘。海面杂波、云层阴影、小岛都容易被误检。把这些图作为负样本加入训练能显著降低误报。负样本不需要标注YOLO 里放空 txt 即可。4. 潜艇卫星图检测的避坑与排查五个血泪教训4.1 现象训练 loss 正常下降但 mAP 一直是 0原因标注格式不对。YOLO 要求归一化坐标如果转换时忘了除以宽高坐标全是几百的整数模型学不到东西。或者类别 id 从 1 开始YOLO 要求从 0 开始。解决打开一个 label txt 文件确认所有值都在 0-1 之间。如果不在检查转换脚本的归一化步骤。类别 id 用class_map显式映射别依赖标注文件里的原始 id。4.2 现象验证集 mAP 很高但实际推理漏检严重原因训练集和验证集同分布但实际场景的卫星图分辨率、光照、海况跟数据集不一样。或者验证集划分时同一区域的图跨了集指标虚高。解决按区域重新划分验证集确保验证集区域跟训练集不重叠。另外实际推理时把输入分辨率提到跟训练一致别用默认 640。4.3 现象模型把海浪杂波检测成潜艇原因负样本不足。训练集里全是带潜艇的图模型没见过纯海面把高频纹理当成目标特征。解决加入负样本图空 txt 标注。负样本比例控制在 10%-20%太多会拉低召回。另外推理时提高置信度阈值从 0.25 提到 0.4 试试。4.4 现象旋转框训练时 loss 震荡不收敛原因旋转框的角度定义不一致。mmrotate 里角度有 le90、le135、oc 等多种定义数据标注和配置不匹配时角度回归会乱。解决确认标注文件的角度定义跟配置一致。DOTA 格式默认是 le90如果标注是 le135需要在配置里改angle_version。另外学习率别设太大旋转框回归比水平框敏感lr0从 0.01 降到 0.005 试试。4.5 现象推理速度慢达不到实时原因输入分辨率太高或者模型太大。1024 输入的 YOLOv8s 在单卡上大概 20-30 FPS如果要求实时得降分辨率或换更小的模型。解决先确认业务是否真的需要实时。卫星图检测通常是离线批处理不需要实时。如果确实要实时用 YOLOv8n 加 640 输入但小目标漏检会变多需要权衡。5. 验证与调优用混淆矩阵和 PR 曲线定位问题训练完不是看一个 mAP 就完事。打开 YOLO 输出的混淆矩阵看误检和漏检分别集中在哪。潜艇检测常见的是把“潜艇”和“舰船”搞混如果数据集里这两类都有混淆矩阵会直接告诉你。如果只有一类看背景误检率也就是有多少背景被误判成潜艇。PR 曲线看的是不同置信度下的精确率和召回率。潜艇检测通常要求高召回因为漏掉一个潜艇比误报一个严重。把置信度阈值调到召回率 0.9 以上看精确率掉到多少。如果精确率低于 0.5说明误报太多得加负样本或提高模型容量。from ultralytics import YOLO import matplotlib.pyplot as plt model YOLO(runs/detect/train/weights/best.pt) metrics model.val(datasubmarine.yaml, imgsz1024, conf0.001, iou0.5) # 打印各类别的AP for i, name in enumerate(metrics.names): print(f{name}: AP50{metrics.box.ap50[i]:.3f}, AP{metrics.box.ap[i]:.3f}) # 绘制PR曲线 metrics.box.plot_pr_curve() plt.savefig(pr_curve.png)这段代码加载训练好的模型在验证集上跑评估。conf0.001是为了画完整的 PR 曲线实际部署时用 0.25 或更高。metrics.box.ap50是 IoU0.5 时的 APmetrics.box.ap是 IoU0.5:0.95 的平均 AP。潜艇检测主要看 AP50因为定位精度要求没那么高。调优方向按优先级排先加数据再加负样本再调输入分辨率最后才动模型结构。我见过太多人一上来就改网络结果数据里一堆错标改什么都没用。卫星图数据集的质量比模型重要得多标注框有没有把潜艇完整框住、有没有漏标、类别有没有标错这些检查一遍比调参一周都管用。还有一个习惯每次训练完把预测结果可视化几张肉眼看看漏在哪、误检在哪。指标是黑匣子图是真相。我一般会抽 20 张验证集图用model.predict跑一遍存下来对比。如果发现某个区域的图普遍漏检大概率是那个区域的海况跟训练集差异大得补数据。希望帮到你。本文还有配套的精品资源点击获取