目标检测数据集——无人机视觉VisDrone数据集

优质文章学习记录

07 Apr 2026 — 4 min read

随着无人机技术的飞速发展，无人机在航拍、监控、农业、物流等领域的应用日益广泛。与此同时，无人机视角下的视觉任务，如目标检测、目标跟踪和场景理解，也成为了计算机视觉研究的热点。然而，相比传统的地面视角数据集，无人机视角下的图像具有高度变化、小目标密集、复杂背景等独特挑战，这对现有算法提出了更高的要求。

为了应对这些挑战并推动无人机视觉技术的发展，天津大学机器学习与数据挖掘实验室推出了 VisDrone数据集。作为一个大规模、标注精细的无人机视觉数据集，VisDrone 不仅涵盖了丰富的场景和多样化的目标类别，还为研究人员提供了一个极具挑战性的测试平台。无论是小目标检测的精度提升，还是密集场景下的鲁棒性优化，VisDrone 都成为了学术界和工业界不可或缺的资源。该数据集采集自中国14个不同城市，覆盖复杂城市场景、交通枢纽、密集人群等多种环境。

VisDrone官方Github下载渠道可点击访问：

https://github.com/VisDrone/VisDrone-Dataset?tab=readme-ov-file

下载的数据集为VisDrone2019-DET-train，VisDrone2019-DET-val，VisDrone2019-DET-test-dev均含有标注，VisDrone2019-DET-test-challenge不含标注因此不在本文处理好的数据集中。

训练集：6,471张图像
验证集：548张图像
测试集：1610张图像

下载下来的原始数据集为jpg+txt文件，这里的txt不是yolo训练可用的txt文件，需要对数据处理后才能使用。这里我提供一个处理好的可直接用于目标检测训练的jpg+xml+txt文件。图片有两个文件夹，分别为原图和覆盖白色方块的图，可自行选择使用。

官方共有12个分类，分别为：

其中ignored regions为忽略的区域，有些区域包含了密集的很小的目标，无法进行标注的，所以我们要把这个区域忽视掉。因此对于这部分内容我们将这个区域从图片中覆盖白色方块进行遮挡。效果如下图。

带有白色方块及标注框的效果如下图

同样我提供了覆盖白色方块的图片和未覆盖白色方块的图片，需要用哪个可自行选择使用。

others忽略掉，因此转换后的类别共有10类，分别为：

["pedestrian", "people", "bicycle", "car", "van", "truck", "tricycle", "awning-tricycle", "bus", "motor"]

即获取的YOLO格式的类别顺序为上述顺序。

下图为训练过程中部分图像

下图为验证过程中部分图像

训练使用原图进行训练，整体精度在0.4左右。覆盖了白色方块的精度可自行测试精度。

下载数据集可以访问官网获取原始数据集：Github

需要处理后的数据集可通过 V🔍：笑脸惹桃花获取。

Read more

2026新手小白AI创业变现指南（二）- AI写作辅助平台

2026新手小白AI创业变现指南（二）- AI写作辅助平台

刚刚更新了2026新手小白AI创业变现指南l列表，新增加了测试过的炼字工坊、蛙蛙写作、笔杆平台（学术论文平台，非通用写作平台）。想简单介绍下，详情请点击2026新手小白AI创业变现指南（一）中平台列表中平台名称看详细介绍。一、炼字工坊平台基础信息项目内容平台名称炼字工坊官方网址https://lianzigongfang.com平台介绍专为网文/剧本/漫剧作者设计的AI创作平台，帮你把精力花在“故事和表达”上，把重复、耗时、卡壳的部分交给AI。相比通用AI，炼字工坊在长篇稳定性上有明显优势。它用「问答+抽卡」帮你定题材卖点，用「设定库」自动归档世界观和角色，用「分层大纲」把控剧情节奏，用「续写润色」解决卡文问题。最重要的是：你的作品不会用于AI训练，版权完全归你。核心定位长篇创作的全流程辅助，从灵感、设定到续写、润色，让你专注创作本身。 🎯 它和通用AI（如DeepSeek、千问）

【论文阅读】ColorFlow: Retrieval-Augmented Image Sequence Colorization

【论文阅读】ColorFlow: Retrieval-Augmented Image Sequence Colorization

基于检索增强的漫画/图片序列上色任务。 intro 现有问题：不是把一张黑白图随便上色，而是要在同一角色跨多张分镜/多帧时，尽量保持发色、衣服配色等“身份颜色（ID color）”一致，而且还要让操作流程“像工具”一样好用：不需要为每个角色单独 finetune，也不强行抽取显式的 ID embedding。论文把整个方案拆成三个阶段：RAP（检索增强）、ICP（in-context 扩散上色）、GSRP（引导式超分复原）。任务设定：Reference-based Image Sequence Colorization * 输入：一张待上色的黑白图（来自漫画/分镜序列中的某一帧）+ 一个“参考图池”（同章节或同序列里若干张已经有颜色的图）。 * 输出：一张彩色结果，要求在序列层面尽量保持角色/物体的颜色身份一致（例如同一角色的头发颜色在多帧一致）。 * 关键难点：参考池里信息多、分镜构图变化大、同角色会变形/

OpenClaw之Memory配置成本地模式，Ubuntu+CUDA+cuDNN+llama.cpp

文章目录 * 背景：Memory不生效的问题 * OpenClaw的Memory配置 * Ubuntu24.04安装CUDA和cuDNN * 编译llama.cpp * 验证方案1： * 验证方案2：下载并运行Llama-2 7B模型 * 安装node-llama-cpp * 验证Memory * sqlite-vec unavailable * 踩过的坑 * 安装node-llama-cpp的一些提示 * 安装node-llama-cpp的前置条件 * Using `node-llama-cpp` With Vulkan 承接上文：Windows11基于WSL2首次运行Openclaw，并对接飞书应用，我已经在电脑上安装了OpenClaw，接下来解决Memory问题。走了很多弯路，下面主要讲我总结的正确的安装过程。总结来说：针对Memory不生效的问题，又不想用OpenAI或Gemini，或者只想单纯的节省token，可以按照如下的方式，设置为local模式： * 修改openclaw.json配置 * 安装CUDA和cu

论文阅读详细版K-RagRec：Knowledge Graph Retrieval-Augmented Generation for LLM-based Recommendation

摘要（Abstract）翻译推荐系统在我们的日常生活中变得越来越重要，有助于缓解各类面向用户的在线服务中的信息过载问题。大语言模型（LLMs）的出现取得了显著成就，展现出其推动下一代推荐系统发展的潜力。尽管取得了这些进展，基于大语言模型的推荐系统仍面临源于其模型架构的固有局限性，尤其是幻觉问题（生成虚假信息）以及缺乏最新知识和领域特定知识的问题。近年来，检索增强生成（RAG）技术受到了广泛关注，它通过利用外部知识源来增强大语言模型的理解和生成能力，从而解决这些局限性。然而，传统的 RAG 方法往往会引入噪声，并且忽略了知识中的结构化关系，这限制了它们在基于大语言模型推荐系统中的效果。为了解决这些问题，我们提出从知识图谱中检索高质量、最新的结构化信息，以增强推荐效果。具体而言，我们设计了一个检索增强框架，名为 K-RagRec，该框架通过整合外部知识图谱的结构化信息，助力推荐生成过程。我们进行了大量实验，验证了所提方法的有效性。讲解 * 摘要就是论文的 “浓缩版故事”，核心逻辑： 1. 背景：推荐系统很重要，大语言模型能做推荐，但有两个大问题 ——“瞎编（幻觉）”