大模型微调主要框架 Firefly vs LLaMA Factory 全方位对比表

优质文章学习记录

07 Apr 2026 — 5 min read

Firefly vs LLaMA Factory 全方位对比表 + 生物医药垂类微调选型建议

一、核心维度对比表格

对比维度	Firefly（流萤）	LLaMA Factory
开发主体	个人开源：杨建新（YeungNLP），前Shopee NLP工程师，中山大学硕士	社区开源：hiyouga核心维护，全球开源社区协同迭代
项目定位	聚焦中文大模型的轻量化训练框架+配套中文优化模型	通用型全栈大模型微调框架，无语言/模型偏向，极致兼容
支持基座模型	以中文友好模型为主（Llama系列、Qwen、ChatGLM、Firefly自训模型），覆盖有限但深度适配	全主流开源模型全覆盖（Llama、Qwen、Mistral、DeepSeek、GLM、Yi、Firefly等），几乎无适配成本
支持微调方式	基础SFT、LoRA/QLoRA、增量预训练，进阶对齐方法较少	SFT、DPO/IPO/KTO、RLHF、预训练、多模态微调，全流程对齐方案完整
中文优化	原生深度优化：中文分词、语料、表达逻辑专项适配，中文生成质感最优	通用框架无原生中文特化，依赖基座模型本身中文能力，可通过数据弥补
使用门槛	配置简洁、脚本轻量化，中文新手教程充足，上手快	UI/命令行双模式，模板化YAML配置，零代码WebUI，新手友好度拉满
硬件显存优化	支持4/8bit量化、QLoRA，单卡消费级显卡可跑7B~13B模型	量化、LoRA、梯度检查点、多卡并行等优化更全面，大参数模型适配性更强
文档&社区	中文文档完善，作者公众号/知乎答疑，社区规模中等，问题响应较快	国内外社区双活跃，Issue/教程/二次开发案例极多，复杂问题解决方案丰富
部署导出	支持基础量化导出、本地推理，生产级部署工具链简易	多格式导出（LoRA合并、GGUF、GPTQ、AWQ），对接主流推理框架，生产部署完整
扩展性	聚焦中文SFT场景，自定义扩展、多任务适配能力一般	插件化架构，可自定义数据集格式、训练策略、新增模型，扩展性极强
维护频率	稳定迭代，更新节奏偏个人开源节奏	高频更新，新模型、新算法第一时间集成
适用核心人群	中文垂类开发者、个人科研、轻量化中文对话任务	全场景开发者、多模型测试、进阶对齐、复杂垂类、工程化落地

二、核心差异一句话总结

Firefly：专精中文场景，小而精，配置简单，中文生成效果上限高，适合纯中文垂类快速微调。
LLaMA Factory：全能通用框架，大而全，兼容所有模型与微调方法，社区生态无敌，适合试错、多模型对比、进阶训练。

三、通用场景快速选型规则

纯中文对话/文案/国内垂类任务 → 优先 Firefly
多模型轮换测试、需DPO/RLHF进阶对齐、多模态微调 → 必选 LLaMA Factory
新手零基础、追求一键运行、不想处理代码适配 → 优先 LLaMA Factory（WebUI）
追求极致中文流畅度、轻量化脚本、极简部署 → 优先 Firefly
企业生产落地、多格式导出、分布式训练 → 优先 LLaMA Factory

四、结合你的「小分子药物筛选/生物医药垂类」专属建议

结合你做AI生物医药、小分子药物筛选、论文相关垂类微调的需求，给出针对性结论：

1. 优先推荐方案：LLaMA Factory

核心适配理由：

生物医药场景会用到Llama、DeepSeek、Qwen、Yi等多类基座模型，LLaMA Factory无适配成本，可快速对比不同基座在医药数据上的效果。
垂类微调常需要迭代数据、尝试LoRA/量化参数，甚至后续做DPO对齐优化回答准确性，LLaMA Factory全流程支持。
本地消费级显卡训练、低显存环境下，其量化与显存优化比Firefly更细致，大参数模型训练稳定性更好。
生物医药文献多为中英混合，LLaMA Factory不绑定中文特化，可灵活适配双语垂类数据，通用性更强。
社区海量医药/科研垂类微调案例、踩坑文档，遇到训练报错、参数不合理问题更容易找到解决方案。

2. 可选备选方案：Firefly

仅适用于：

你的训练数据100%为中文医药文献、中文问答，极致追求中文表达流畅度。
仅固定使用1~2款中文基座（Qwen/ChatGLM），不做多模型对比，只需要快速完成基础SFT。

3. 最优折中实操方案（兼顾两者优势，最推荐你使用）

采用 LLaMA Factory 框架 + Firefly系列基座模型 组合：

用LLaMA Factory的易用UI、参数优化、全格式支持，降低训练与部署成本。
加载Hugging Face上的Firefly预训练模型（Firefly-Llama、Firefly-Qwen），保留中文深度优化的基础能力。
注入你的小分子药物筛选、DrugBank、ZINC20相关垂类数据做LoRA微调，兼顾通用框架兼容性与中文生成质量。
训练完成后通过LLaMA Factory导出量化模型，本地推理或后续部署都更灵活。

五、极简最终结论

做小分子药物筛选这类科研垂类、多模型测试、双语数据、长期迭代 → 直接用 LLaMA Factory
仅做纯中文医药对话、极简快速微调、不折腾框架 → 用 Firefly
想要兼顾中文效果与框架易用性 → LLaMA Factory 微调 Firefly 基座模型（最适合你的场景）

需要我进一步给出适配生物医药数据格式的LLaMA Factory训练YAML模板、LoRA参数推荐，以及本地显卡（3090/4090）的显存优化配置吗？

一文通透OpenVLA——在Prismatic VLM(SigLIP、DinoV2、Llama 2)的架构上：基于“下一个token预测技术”预测离散化动作

前言当对机器人动作策略的预测越来越成熟稳定之后(比如ACT、比如扩散策略diffusion policy)，为了让机器人可以拥有更好的泛化能力，比较典型的途径之一便是基于预训练过的大语言模型中的广泛知识，然后加一个policy head(当然，一开始背后的模型比较简单，比如有用LSTM或MLP——RoboFlamingo) 再之后，便出来了越来越多成熟稳定的专门的VLA模型，比如OpenVLA，再比如近期介绍过过的π0——用于通用机器人控制的VLA模型：一套框架控制7种机械臂(基于PaliGemma和流匹配的3B模型) 1. π0的意义在于，首次用同一套策略/算法操作不同机器人/机械臂，这种基于机器人大模型的「预训练-微调」模式，很快会越来越多(犹如此前大模型革命NLP 其次CV等各模态，目前到了robot领域)，算是代表了通用机器人的核心发展方向 2. 且π0 比英伟达的HOVER早一点，当然，同时期的RDT GR2也有这个潜力的，期待这两后续的更新一个多月前(本文首发于25年1月)，有朋友曾说，一个月内，π0 会开源来着，当时虽然觉得不太可能，但还是抱着期待，可还

Meta-Llama-3-8B-Instruct避坑指南：从部署到对话全流程解析

Meta-Llama-3-8B-Instruct避坑指南：从部署到对话全流程解析 1. 引言随着大模型技术的快速发展，Meta于2024年4月发布了Llama 3系列中的中等规模版本——Meta-Llama-3-8B-Instruct。该模型在指令遵循、多任务处理和对话能力方面表现出色，尤其适合单卡部署场景。得益于其GPTQ-INT4量化版本仅需约4GB显存，RTX 3060及以上消费级GPU即可流畅运行，成为个人开发者与中小企业构建AI对话应用的理想选择。本文基于vllm + open-webui技术栈，结合实际部署经验，系统梳理从环境配置、模型加载到Web界面集成的完整流程，并重点剖析常见问题及其解决方案，帮助读者高效搭建稳定可用的本地化对话系统。 2. 技术选型与核心优势 2.1 模型特性概览 Meta-Llama-3-8B-Instruct 是一个经过指令微调的80亿参数密集模型，具备以下关键优势： * 高性能低门槛：FP16精度下占用约16GB显存，GPTQ-INT4量化后可压缩至4GB以内，支持RTX 3060/4060等主流消费级显卡。 * 长上

学术党必备神器：paperxie 降重复 | AIGC 率功能，让论文检测一次通关

paperxie-免费查重复率aigc检测/开题报告/毕业论文/智能排版/文献综述/aippt https://www.paperxie.cn/weight?type=1https://www.paperxie.cn/weight?type=1https://www.paperxie.cn/weight?type=1 在 AI 写作普及的今天，学术论文不仅要应对传统的重复率检测，还要面对 AIGC 生成内容的识别筛查。对于高校师生、科研人员来说，如何既保留内容质量，又能顺利通过知网、维普等平台的双重检测，成了一大难题。paperxie 降重复 | AIGC 率功能的出现，正是为了解决这一痛点，凭借全新升级的 AI 语言大模型，为学术内容提供了专业的降重降 AI 率解决方案。一、

Cogito-V1-Preview-Llama-3B 微信小程序开发：集成AI对话功能指南

Cogito-V1-Preview-Llama-3B 微信小程序开发：集成AI对话功能指南最近在做一个微信小程序项目，需要给它加上一个智能对话的功能。用户可以在小程序里提问，然后得到一个像模像样的回答。听起来挺酷，但做起来发现一堆坑：小程序怎么调用外部AI接口？网络慢了怎么办？对话历史怎么存？这些问题不解决，用户体验就上不去。我最后选了Cogito-V1-Preview-Llama-3B这个模型，它体积不大但能力不错，很适合放在服务器上给小程序用。折腾了几天，总算把前后端都跑通了。今天就把整个过程，包括代码怎么写、问题怎么解决，都整理出来。如果你也想在小程序里加个AI助手，这篇文章应该能帮你省不少时间。 1. 项目准备：理清思路与搭建环境在动手写代码之前，得先把整个流程想清楚。我们的目标是：用户在微信小程序里输入问题，小程序把问题发给咱们自己部署好的AI模型服务器，服务器处理完再把答案传回小程序，最后显示给用户。听起来就是“请求-响应”这么简单，但微信小程序有自己的一套规则，不能随便访问外网。所以，我们需要一个自己的后端服务器，作为小程序和AI模型之间的“中间人”。