目标检测数据集——无人机视觉VisDrone数据集

优质文章学习记录

11 Apr 2026 — 4 min read

随着无人机技术的飞速发展，无人机在航拍、监控、农业、物流等领域的应用日益广泛。与此同时，无人机视角下的视觉任务，如目标检测、目标跟踪和场景理解，也成为了计算机视觉研究的热点。然而，相比传统的地面视角数据集，无人机视角下的图像具有高度变化、小目标密集、复杂背景等独特挑战，这对现有算法提出了更高的要求。

为了应对这些挑战并推动无人机视觉技术的发展，天津大学机器学习与数据挖掘实验室推出了 VisDrone数据集。作为一个大规模、标注精细的无人机视觉数据集，VisDrone 不仅涵盖了丰富的场景和多样化的目标类别，还为研究人员提供了一个极具挑战性的测试平台。无论是小目标检测的精度提升，还是密集场景下的鲁棒性优化，VisDrone 都成为了学术界和工业界不可或缺的资源。该数据集采集自中国14个不同城市，覆盖复杂城市场景、交通枢纽、密集人群等多种环境。

VisDrone官方Github下载渠道可点击访问：

https://github.com/VisDrone/VisDrone-Dataset?tab=readme-ov-file

下载的数据集为VisDrone2019-DET-train，VisDrone2019-DET-val，VisDrone2019-DET-test-dev均含有标注，VisDrone2019-DET-test-challenge不含标注因此不在本文处理好的数据集中。

训练集：6,471张图像
验证集：548张图像
测试集：1610张图像

下载下来的原始数据集为jpg+txt文件，这里的txt不是yolo训练可用的txt文件，需要对数据处理后才能使用。这里我提供一个处理好的可直接用于目标检测训练的jpg+xml+txt文件。图片有两个文件夹，分别为原图和覆盖白色方块的图，可自行选择使用。

官方共有12个分类，分别为：

其中ignored regions为忽略的区域，有些区域包含了密集的很小的目标，无法进行标注的，所以我们要把这个区域忽视掉。因此对于这部分内容我们将这个区域从图片中覆盖白色方块进行遮挡。效果如下图。

带有白色方块及标注框的效果如下图

同样我提供了覆盖白色方块的图片和未覆盖白色方块的图片，需要用哪个可自行选择使用。

others忽略掉，因此转换后的类别共有10类，分别为：

["pedestrian", "people", "bicycle", "car", "van", "truck", "tricycle", "awning-tricycle", "bus", "motor"]

即获取的YOLO格式的类别顺序为上述顺序。

下图为训练过程中部分图像

下图为验证过程中部分图像

训练使用原图进行训练，整体精度在0.4左右。覆盖了白色方块的精度可自行测试精度。

下载数据集可以访问官网获取原始数据集：Github

需要处理后的数据集可通过 V🔍：笑脸惹桃花获取。

Read more

2026传媒行业剧变前夜：Agent将成新入口，AIGC引爆内容“核聚变

2026传媒行业剧变前夜：Agent将成新入口，AIGC引爆内容“核聚变” 当AI不再只是工具，而是接管你的意图、重塑你看到的世界时，传媒互联网的底层逻辑正在被彻底改写。最近，一份来自信达证券的《传媒行业2026年度策略报告》在圈内引起了不小的震动。报告标题直指核心——“Agent定义入口，AIGC重塑供给”。这十二个字，精准地描绘了AI从“技术基建期”迈向“应用深水区”后，传媒互联网行业即将迎来的双重剧变。今天，我们就来深度拆解这份报告，看看2026年，我们的数字生活将如何被重新定义。一、入口革命：从“点击”到“对话”，Agent正在“架空”App 互联网的每一个代际，都伴随着超级入口的更迭：PC互联网时代是搜索和浏览器，移动互联网时代是超级App。那么，AI时代的新入口是什么？报告给出了明确的答案：AI Agent（智能体）。这不仅仅是技术升级，更是人机交互的代际跃迁。我们正从基于过程的GUI（图形用户界面），进化到基于结果的IUI（

2025终极指南：whisper.cpp跨平台语音识别部署全流程

2025终极指南：whisper.cpp跨平台语音识别部署全流程【免费下载链接】whisper.cppOpenAI 的 Whisper 模型在 C/C++ 中的移植版本。项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp 还在为语音转文字服务的网络延迟和高成本烦恼？whisper.cpp作为开源语音识别解决方案，提供了本地化部署的完美选择。本文将带你深入了解如何在不同平台上快速部署和使用这个强大的离线语音识别工具。通过本文，你将掌握： * 多平台环境配置的一键安装方法 * 模型下载与优化的性能调优技巧 * 常见部署问题的快速解决方案 * 监控与维护的最佳实践平台选择：找到最适合你的方案平台类型安装难度推理速度内存占用适用场景Windows桌面⭐⭐1.2x1.1GB个人使用Linux服务器⭐⭐⭐1.5x0.9GB企业部署macOS开发⭐2.0x0.7GB移动应用Android设备⭐⭐⭐⭐0.8x0.5GB边缘计算环境搭建：快速启动的完整步骤基础环境准备

文心一言4.5开源模型实战：ERNIE-4.5-0.3B轻量化部署与效能突破

文心一言4.5开源模型实战：ERNIE-4.5-0.3B轻量化部署与效能突破

文心一言4.5开源模型实战：ERNIE-4.5-0.3B轻量化部署与效能突破文心一言4.5开源模型实战：ERNIE-4.5-0.3B轻量化部署与效能突破，本文介绍百度文心一言 4.5 开源模型中 ERNIE-4.5-0.3B 的轻量化部署与效能。该 3 亿参数模型破解大模型落地的算力、效率、安全困局，在 FastDeploy 框架下实现单张 RTX 4090 承载百万级日请求等突破。文章解析其技术架构，给出本地化部署步骤，通过工业场景、中文特色、工程数学计算等测试验证其能力，还提供性能优化、安全加固及故障排查方法，展现其轻量高效与能力均衡特性。引言：轻量化部署的时代突围 ✨ 当行业还在为千亿参数模型的算力消耗争论不休时，百度文心一言4.5开源版本以颠覆性姿态撕开了一条新赛道。2025年6月30日，💥 文心一言4.5系列模型正式开源，其中ERNIE-4.5-0.3B这款仅3亿参数的轻量模型，为破解大模型产业落地的三大困局提供了全新方案： * 算力成本困局：

从零开始：AIGC中的变分自编码器（VAE）代码与实现

从零开始：AIGC中的变分自编码器（VAE）代码与实现

个人主页：chian-ocean 文章专栏深入理解AIGC中的变分自编码器（VAE）及其应用随着AIGC（AI-Generated Content）技术的发展，生成式模型在内容生成中的地位愈发重要。从文本生成到图像生成，变分自编码器（Variational Autoencoder, VAE）作为生成式模型的一种，已经广泛应用于多个领域。本文将详细介绍VAE的理论基础、数学原理、代码实现、实际应用以及与其他生成模型的对比。 1. 什么是变分自编码器（VAE）？变分自编码器（VAE）是一种生成式深度学习模型，结合了传统的概率图模型与深度神经网络，能够在输入空间和隐变量空间之间建立联系。VAE与普通自编码器不同，其目标不仅仅是重建输入，而是学习数据的概率分布，从而生成新的、高质量的样本。 1.1 VAE 的核心特点 * 生成能力：VAE通过学习数据的分布，能够生成与训练数据相似的新样本。 * 隐空间结构化表示：VAE学习的隐变量分布是连续且结构化的，使得插值和生成更加自然。 * 概率建模：VAE通过最大化似然估计，能够对数据分布进行建模，并捕获数据的复杂特性。