LLM项目实战：使用Llama-factory进行DPO训练

优质文章学习记录

05 Apr 2026 — 5 min read

前言

LLM训练三板斧，预训练，微调，RHLF。DPO属于是最后环节RHLF中的一个方法，关于RLHF主流方法有PPO,DPO,GROP。关于这三种介绍RLHF方法，我之前分享过对着三种方法的一些思考，有兴趣的同学可以看看。

因为DPO对硬件的需求最小，显存占用最低，所以我们先采用DPO进行训练。

硬件信息：

4070 12g*2 、64g内存、操作系统:Ubuntu24.04、模型：QWEN-3vl-2B（因为我这个模型是上个多模态任务sft过的，所以选择vl模型，没有图片输入需求的同学可以下载纯语言模型）

本篇教程仅关于DPO训练，请提前配置好环境和下载好LLamafactory（关于llamafactory环境配置其实也是一大头疼的点，注意如果想要使用分布式训练，llamafactory仅支持到deeospeed10.0-16.0，截止到2025年11月20日llamafactory还没有完成对deepspeed最新版本的适配

碎碎念：很多初学大模型的同学还是使用Windows系统进行训练，本人之前也是。但是由于Windows总是出现各种奇怪的报错和显存不稳定等情况，尤其是在多卡训练中，这种情况会更加明显。后来也尝试过wsl2其他替代方案，最后还是发现linux系统有着win无法替代的优势。所以还是建议如果真想长期学习LLM的同学，直接一步到位到linux系统，少走弯路：）

llamafactory以下简称LF

STEP1 从hugging face下载我们需要的数据库

这里采用的是hugging face中的一个医疗DPO数据集

from datasets import load_dataset # 加载数据集 ds = load_dataset("HANI-LAB/Med-REFL-DPO",'reasoning_enhancement')

print(ds['train'][:1])

这里看到数据是可以正常加载的

STEP2 对数据进行预处理

由于我们需要使用llamafactory的框架进行dpo训练，所以需要把源arrow格式的文件转为lf能识别的json格式。下面这是官方文档中的规范格式，我们编写一个python程序完成格式的对齐

[ { "instruction": "人类指令（必填）", "input": "人类输入（选填）", "chosen": "优质回答（必填）", "rejected": "劣质回答（必填）" } ]

import json from datasets import load_dataset import os def convert_arrow_to_json(dataset_path, output_json_path): """ 将 Arrow 格式的数据集转换为指定的 JSON 格式 Args: dataset_path: Arrow 数据集的路径或 Hugging Face 数据集标识 output_json_path: 输出 JSON 文件的路径 """ # 加载数据集 # 如果是本地文件，可以使用 'load_from_disk' if os.path.exists(dataset_path): # 加载本地的 Arrow 数据集 dataset = load_dataset('arrow', data_files=dataset_path) else: dataset = load_dataset(dataset_path, name='reasoning_enhancement') # 获取训练集（根据你的描述，数据在 train split 中） train_dataset = dataset['train'] # 转换为所需的 JSON 格式 output_data = [] for item in train_dataset: # 确保所有必填字段都存在 if 'instruction' in item and 'chosen' in item and 'rejected' in item: json_item = { "instruction": item['instruction'], "input": item.get('input', ''), # input 是选填的，默认空字符串 "chosen": item['chosen'], "rejected": item['rejected'] } output_data.append(json_item) # 保存为 JSON 文件 with open(output_json_path, 'w', encoding='utf-8') as f: json.dump(output_data, f, ensure_ascii=False, indent=2) print(f"转换完成！共处理了 {len(output_data)} 条数据") print(f"JSON 文件已保存到: {output_json_path}") def main(): # 本地 Arrow 文件路径 arrow_file_path = "path/to/your/Reasoning Enhancement.arrow" # 输出 JSON 文件路径 output_json_path = "med_refl_dpo.json" # 执行转换 convert_arrow_to_json(arrow_file_path, output_json_path) if __name__ == "__main__": main()

完成数据集的标准化后，我们将获得的json文件复制到lf的data目录下。

之后我们需要修改 LLaMaFactory data目录下的dataset_info.json，增加自定义数据集：（官网也给出了添加数据集的标准格式）

"数据集名称": { "file_name": "data.json", "ranking": true, "columns": { "prompt": "instruction", "query": "input", "chosen": "chosen", "rejected": "rejected" } }

"MED_DPO": { "file_name": "/home/zadyd/桌面/xza/LLaMA-Factory/data/med_dpo.json", "ranking": true, "columns": { "prompt": "instruction", "query": "input", "chosen": "chosen", "rejected": "rejected" } },

STEP3 启动LF,选择合适的参数

在lm文件夹下启动终端，输入llamafactory-cli webui启动我们的可视化ui

如果是windows系统，则打开终端cd到lf目录

在网页端设置我们需要的参数，一般像我这样设置就可以

因为我是多卡训练，所以选择了 deepspeed，单卡训练的同学不需要勾选这个选项，本次训练需要 24g 左右的显存，这个显存大小有点尴尬，可以通过开启量化或者减少序列长度节约显存

大概需要 12 个小时，这一步很容易遇到环境不兼容的问题，需要耐心调整，不要心急

STEP4 合并模型

训练完成之后在 export 模块，选择训练好的文件位置，和原始文件进行合并

C++ 方向 Web 自动化测试入门指南：从概念到 Selenium 实战

🔥草莓熊Lotso：个人主页 ❄️个人专栏: 《C++知识分享》《Linux 入门到实践：零基础也能懂》 ✨生活是默默的坚持，毅力是永久的享受！ 🎬 博主简介：文章目录 * 前言： * 一. 自动化测试基础：先搞懂"为什么"和"做什么" * 1.1 自动化测试的核心目标：回归测试 * 1.2 自动化测试分类：别把 “不同自动化” 混为一谈 * 1.3 自动化测试金字塔：如何分配测试资源？ * 二. Web 自动化测试核心：环境搭建与驱动管理 * 2.1 核心组件原理：三者如何协同工作？ * 2.2 环境搭建：3 步搞定依赖安装

web的分离不分离：前后端分离与不分离全面分析

让我们一起走向未来 🎓作者简介：全栈领域优质创作者 🌐个人主页：百锦再@新空间代码工作室 📞工作室：新空间代码工作室（提供各种软件服务） 💌个人邮箱：[[email protected]] 📱个人微信：15045666310 🌐网站：https://meihua150.cn/ 💡座右铭：坚持自己的坚持，不要迷失自己！要快乐目录 * 让我们一起走向未来 * 一、前后端分离 * 原理 * 优点 * 缺点 * 代码举例（前后端分离）： * 二、不分离（传统架构） * 原理 * 优点 * 缺点 * 代码举例（不分离）： * 三、总结在这里插入图片描述前后端分离与不分离是当前Web开发中两种常见的架构模式。它们各有优缺点，适用于不同的开发需求和场景。一、前后端分离原理前后端分离是指将前端（

mT5分类增强版中文-base保姆级教程：WebUI响应超时设置与GPU OOM预防措施

mT5分类增强版中文-base保姆级教程：WebUI响应超时设置与GPU OOM预防措施 1. 这不是普通文本增强，而是全任务零样本学习的中文利器你有没有遇到过这样的问题：手头只有一小段中文文本，却要快速生成语义一致、表达多样的多个版本？传统方法要么靠人工反复改写，耗时费力；要么用通用大模型，结果跑偏、重复、不专业。而今天要介绍的这个模型，彻底改变了这种局面。它叫mT5分类增强版中文-base——名字有点长，但记住三个关键词就够了：零样本、中文专精、稳定输出。它不是简单地在英文mT5基础上加点中文数据微调，而是在大量高质量中文语料上做了深度再训练，并特别引入了零样本分类增强技术。这意味着：你不需要准备任何标注数据，也不用写复杂的提示词，只要输入一句话，它就能理解你的意图，自动生成几个风格不同、逻辑通顺、符合中文表达习惯的增强版本。更关键的是，它的输出稳定性远超同类模型。我们实测过上千条日常短句（比如“用户投诉物流太慢”“产品页面加载卡顿”“客服回复不及时”），92%以上的生成结果语义准确、无事实错误、无生硬翻译感。这不是“能用”，而是“敢用”

【Web-Crawler-Steamdt】以项目文件steamdt_crawler.py学习python爬虫

https://github.com/stefanokratzdisteln-hash/Web-Crawler-Steamdt 以下是 steamdt_crawler.py 中的主要知识点整理，适合有 Python 基础的学习者学习爬虫：一、爬虫基础与工具选择 1. 动态 vs 静态网页爬取 * Playwright：用于处理 JavaScript 动态渲染的网页（现代 SPA 应用） * Requests + BeautifulSoup：用于静态 HTML 页面（传统网页） * 代码中通过 PLAYWRIGHT_AVAILABLE 判断并自动降级 2. 环境与编码处理 # Windows 控制台编码修复if sys.platform =='win32': sys.stdout = io.TextIOWrapper(sys.

前言