NWPU VHR-10数据集无人机遥感目标检测数据集飞机储罐棒球场网球场篮球场港口车辆桥梁检测遥感图像中的地理空间目标检测

优质文章学习记录

05 Apr 2026 — 5 min read

NWPU VHR-10数据集遥感数据集

NWPU VHR-10数据集是 10个类别地理空间目标检测的挑战性数据集，共650张图片。

YOLO和COCO格式

数据集按默认划分比例：390张训练集、130张验证集、130张测试集。

手动标注了757架飞机、302艘船只、655个储罐、390个棒球场、524个网球场、159个篮球场、163个田径场、224个港口、124座桥梁和598辆车辆。

📊 一、数据集总体信息

项目	描述
数据集名称	NWPU VHR-10（Northwestern Polytechnical University Very High Resolution 10-class Dataset）
任务类型	遥感图像中的地理空间目标检测（Object Detection in Remote Sensing Images）
图像总数	650 张（均为高分辨率遥感图像，源自 Google Earth 等平台）
图像分辨率	约 600×600 至 1000×1000 像素，空间分辨率高
标注格式	✅ YOLO TXT 格式 ✅ COCO JSON 格式（开箱即用，无需转换）
数据划分	- 训练集：390 张 - 验证集：130 张 - 测试集：130 张（比例 ≈ 6:2:2）
应用场景	军事侦察、城市规划、灾害评估、智能遥感解译等

🏷️ 二、类别定义与实例数量统计

类别 ID	类别名称（英文）	类别名称（中文）	标注实例数量
0	Airplane	飞机	757
1	Ship	船只	302
2	Storage Tank	储罐	655
3	Baseball Diamond	棒球场	390
4	Tennis Court	网球场	524
5	Basketball Court	篮球场	159
6	Ground Track Field	田径场	163
7	Harbor	港口	224
8	Bridge	桥梁	124
9	Vehicle	车辆	598

🔢 总标注目标数：3,896 个
📌 所有目标均以 水平边界框（Axis-Aligned Bounding Box） 标注。

📁 三、推荐使用方式

用途	建议
模型训练	直接使用提供的 YOLO 或 COCO 格式，适配 YOLOv5/v8、MMDetection、Detectron2 等主流框架
评估指标	通常采用 [email protected]（IoU=0.5）作为主指标
挑战点	• 小目标（如车辆、飞机） • 类间尺度差异大（港口 vs 车辆） • 背景复杂（城市、水域、农田混合）
扩展建议	可结合 DIOR、DOTA 等遥感数据集进行跨域泛化研究

📁 一、项目结构建议

nwpu_vhr10_yolo/ ├── dataset.yaml # 数据集配置文件 ├── train.py # 主训练脚本 ├── predict_demo.py # 推理演示 ├── export_model.py # 模型导出脚本 └── data/ ├── images/ │ ├── train/ # 390 张训练图像 │ ├── val/ # 130 张验证图像 │ └── test/ # 130 张测试图像 └── labels/ ├── train/ # 对应 .txt 标注（YOLO格式） ├── val/ └── test/

✅ 假设你已将官方提供的 YOLO 格式数据按上述结构组织。

📄 二、数据集配置文件 `dataset.yaml`

# dataset.yamlpath: ./data train: images/train val: images/val test: images/test nc:10names:['airplane','ship','storage_tank','baseball_diamond','tennis_court','basketball_court','ground_track_field','harbor','bridge','vehicle']

🚀 三、详细训练代码 `train.py`

# train.pyfrom ultralytics import YOLO import torch defmain(): device ='cuda'if torch.cuda.is_available()else'cpu'print(f"🚀 使用设备: {device}")# 选择模型（遥感小目标多，推荐 yolov8m 或 yolov8l） model_name ="yolov8m.pt"# 可选: yolov8s / yolov8l / yolov8x project_name ="nwpu_vhr10_detection"# 加载预训练模型 model = YOLO(model_name)# 开始训练 results = model.train( data='dataset.yaml', epochs=150,# 遥感数据复杂，建议充分训练 imgsz=640,# NWPU 图像较小，640 足够；若需更高精度可用 1024 batch=16,# 640 分辨率下 batch=16（32G 显存可设 32） name=project_name, device=device, patience=30,# 早停机制（验证集 mAP 不升则停） save=True, plots=True,# 自动生成 PR 曲线、混淆矩阵、样本可视化 exist_ok=False, workers=8, optimizer='AdamW', lr0=0.01, lrf=0.01,# 数据增强（关键！提升小目标和尺度变化鲁棒性） augment=True, hsv_h=0.015, hsv_s=0.7, hsv_v=0.4, degrees=15.0,# ±15° 旋转（遥感视角多样） translate=0.1, scale=0.5, flipud=0.0,# 不上下翻转（地理目标方向敏感） fliplr=0.5,# 左右翻转安全 mosaic=1.0,# Mosaic 增强（对小目标如 vehicle/airplane 极有效） mixup=0.1)# 在测试集上评估最终性能 metrics = model.val(data='dataset.yaml', split='test')print("\n✅ NWPU VHR-10 测试集结果:")print(f" [email protected] (all): {metrics.box.map50:.5f}")print(f" [email protected]:0.95: {metrics.box.map:.5f}")print(f" Precision: {metrics.box.mp:.5f}")print(f" Recall: {metrics.box.mr:.5f}")if __name__ =='__main__': main()

运行命令：

python train.py

🔍 四、推理演示 `predict_demo.py`

# predict_demo.pyfrom ultralytics import YOLO model = YOLO('runs/detect/nwpu_vhr10_detection/weights/best.pt') results = model.predict( source='test_image.jpg', conf=0.25,# 遥感小目标建议降低阈值 iou=0.45, save=True, show=True, line_width=2, font_size=12)# 打印检测结果 class_names =['Airplane','Ship','Storage Tank','Baseball Diamond','Tennis Court','Basketball Court','Ground Track Field','Harbor','Bridge','Vehicle']for result in results: boxes = result.boxes print(f"检测到 {len(boxes)} 个目标")for box in boxes: cls_id =int(box.cls.item()) conf =float(box.conf.item())print(f" → {class_names[cls_id]} (置信度: {conf:.3f})")

📤 五、模型导出（用于部署）

# export_model.pyfrom ultralytics import YOLO model = YOLO('runs/detect/nwpu_vhr10_detection/weights/best.pt')# 导出为 ONNX（通用） model.export(format='onnx', imgsz=640, simplify=True)# 导出为 TensorRT（NVIDIA GPU / Jetson） model.export(format='engine', imgsz=640, half=True, device=0)# 导出为 OpenVINO（Intel CPU） model.export(format='openvino', imgsz=640)

⚙️ 六、训练优化建议

挑战	解决方案
小目标漏检（如车辆、飞机）	启用 `mosaic=1.0`，使用 `imgsz=1024`（若显存允许）
类别不平衡（如桥梁仅124个）	YOLOv8 内置 Focal Loss 变体，通常无需额外处理；也可对稀有类过采样
背景复杂干扰	增加 `hsv_v` 和 `degrees` 增强，提升光照与角度鲁棒性
实时遥感分析	若部署于边缘设备（如无人机），可改用 `yolov8s` + TensorRT

Being-H0.5：扩展以人为中心的机器人学习实现跨具身泛化

26年1月来自的BeingBeyond团队的论文“Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization”。 Being-H0.5 是一个基础视觉-语言-动作 (VLA) 模型，旨在实现跨不同机器人平台的鲁棒跨具身泛化。现有的 VLA 模型通常难以应对形态异质性和数据稀缺性，而提出的一种以人为中心学习范式，将人类交互痕迹视为物理交互的通用“母语”。为了支持这一范式，推出 UniHand-2.0，这是迄今为止规模最大的具身预训练方案，包含来自 30 种不同机器人具身的超过 35,000 小时多模态数据。该方法引入一个统一动作空间，将异构的机器人控制映射到语义对齐槽中，使低资源机器人能够从人类数据和高资源平台中引导技能。基于这一以人为中心的基础，设计一个统一的序列建模和多任务预训练范式，以连接人类演示和机器人执行。在架构上，Being-H0.5 采用混合 Transformer （MoT）设计，并引入一种混合流 (MoF) 框架，将共享的运动基元与特定于具身的专家解耦。

Reachy Mini：重新定义桌面机器人的开源硬件革命

Reachy Mini：重新定义桌面机器人的开源硬件革命【免费下载链接】reachy_miniReachy Mini's SDK 项目地址: https://gitcode.com/GitHub_Trending/re/reachy_mini 在当今机器人技术快速发展的时代，桌面机器人作为开源硬件的重要分支，正以其独特的魅力吸引着全球开发者的目光。Reachy Mini作为这一领域的杰出代表，不仅展示了精密机械设计的极致追求，更为机器人爱好者提供了前所未有的学习与实践平台。设计哲学：模块化与可访问性的完美平衡让我们深入理解Reachy Mini背后的设计理念。与传统机器人设计不同，它采用了分层模块化架构，将复杂的机械系统分解为可独立制造和替换的功能单元。这种设计哲学的核心在于：让每个组件都具备明确的边界和标准化的接口，使得维护、升级和定制变得异常简单。核心设计原则： * 教育导向：每个设计决策都考虑到学习价值 * 制造友好：所有部件都针对3D打印工艺优化 * 成本控制：通过开源设计降低准入门槛 * 扩展灵活：预留充分的接口用于功能扩展核心子系统解

【2025最新高维多目标优化】基于城市场景下无人机三维路径规划的导航变量的多目标粒子群优化算法NMOPSO研究（Matlab代码实现）

💥💥💞💞欢迎来到本博客❤️❤️💥💥 🏆博主优势：🌞🌞🌞博客内容尽量做到思维缜密，逻辑清晰，为了方便读者。 ⛳️座右铭：行百里者，半于九十。 📋📋📋本文内容如下：🎁🎁🎁 ⛳️赠与读者 👨‍💻做科研，涉及到一个深在的思想系统，需要科研者逻辑缜密，踏实认真，但是不能只是努力，很多时候借力比努力更重要，然后还要有仰望星空的创新点和启发点。建议读者按目录次序逐一浏览，免得骤然跌入幽暗的迷宫找不到来时的路，它不足为你揭示全部问题的答案，但若能解答你胸中升起的一朵朵疑云，也未尝不会酿成晚霞斑斓的别一番景致，万一它给你带来了一场精神世界的苦雨，那就借机洗刷一下原来存放在那儿的“躺平”上的尘埃吧。或许，雨过云收，神驰的天地更清朗.......🔎🔎🔎 💥1 概述基于城市场景下无人机三维路径规划的导航变量的多目标粒子群优化算法（NMOPSO）研究摘要随着无人机应用场景的复杂化，城市场景下的三维路径规划需同时优化路径长度、飞行时间、威胁规避、能耗等多个相互冲突的目标。

Cameralink 图像输出和采集时序，针对FPGA开发

Cameralink使用接口芯片进行开发的时候，例如国产芯片GM8283、GM8284，GM8284等等。都可以支持宽温85Mhz以上。老外的芯片：例如DS90CR285. DS90CR2856 ，DS90CR287.DS90CR288. 精典的Cameralink接口芯片。那么FPGA接这些芯片的时候，给的时序可以参考Cameralink标准定义进行。下面进行一些举例说明。（1）mono8, 8Tap 黑白图像该模式下，一个时钟输出8个x方向的相邻像素，占用A、B、C、D、E、F、G、H共8个通道，A通道输出tap1，B通道输出tap2，C通道输出tap3，D通道输出tap4，E通道输出tap5，F通道输出tap6，G通道输出tap7，H通道输出tap8，如下图所示。具体时序图，如下所示。图像分辨率为m行和n列，那么一个FVAL信号包括m个LVAL信号，一个LVAL信号包括n/8个CLOCK时钟。数据输出的有效期或者无效期，时钟信号CLOCK一直有效，时钟