大模型基于llama.cpp量化详解

优质文章学习记录

08 Apr 2026 — 3 min read

概述

llama.cpp 是一个高性能的 LLM 推理库，支持在各种硬件（包括 CPU 和 GPU）上运行量化后的大语言模型。本文档详细介绍如何使用 llama.cpp 将 HuggingFace 格式的模型转换为 GGUF 格式，并进行不同程度的量化。

GGUF 格式：GGUF（Georgi Gerganov Universal Format）是 llama.cpp 专门设计的模型文件格式，针对快速加载和保存模型进行了优化，支持单文件部署，包含加载模型所需的所有信息，无需依赖外部文件。

1.安装cmake
CMake 是跨平台的构建工具，用于编译 llama.cpp 项目。

下载地址：https://cmake.org/download/

安装建议：

Windows 用户建议下载 cmake-3.x.x-windows-x86_64.msi 安装包
安装时选择 “Add CMake to the system PATH”，以便在命令行中直接使用

验证安装：

cmake --version 2.安装llama.cpp ```bash git clone https://github.com/ggerganov/llama.cpp

convert_hf_to_gguf.py：HuggingFace 格式转 GGUF 的脚本
llama-quantize（或 quantize.exe）：量化工具
main（或 main.exe）：推理主程序
examples/：各种示例程序

3.编译

cd llama.cpp pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple pip install -r requirements/requirements-convert_hf_to_gguf.txt cmake -G "MinGW Makefiles" -DCMAKE_C_COMPILER=gcc -DCMAKE_CXX_COMPILER=g++ -B build cmake --build build --config Release

4.模型转换
将safetensors转换为gguf

 convert-hf-to-gguf.py D:\\Project\\2026\\llama3-lora-merge --outtype f16 --outfile D:\\Project\\2026\\my_llama3.gguf

参数说明：
D:\Project\2026\llama3-lora-merge：输入模型路径（包含 config.json 和权重文件的目录）
–outtype f16：输出类型，f16 表示半精度浮点数（16-bit），可选 f32（全精度）或 bf16
–outfile：输出 GGUF 文件路径

类型	精度	说明
`f32`	32-bit	全精度，文件最大，精度最高
`f16`	16-bit	半精度，平衡选择
`bf16`	16-bit	Brain Float，动态范围更大
`q8_0`	8-bit	直接量化为 8 位

6.进一步量化

 D:\Project\2026\test_llama3.cpp\llama.cpp\build\bin\Release quantize.exe D:\\Project\\2026\\my_llama3.gguf D:\\Project\\2026\\quantized_model.gguf q4_0

llama-quantize可执行文件来对模型进行进一步量化处理。量化可以帮助我们减少模型的大小，但是代价是损失了模型精度，也就是模型回答的能力可能有所下降。权衡以后我们可以选择合适的量化参数，保证模型的最大效益。
量化使用 q 表示存储权重的位数。位数越低，模型越小，速度越快，但精度损失越大。

量化类型	位宽	精度损失	适用场景	典型压缩率
`q2_k`	2-bit	高	极低资源环境，实验用途	~75%
`q3_k_s` / `q3_k_m` / `q3_k_l`	3-bit	中高	资源受限，可接受一定质量损失	~60%
`q4_0` / `q4_1`	4-bit	中	最常用，平衡大小与质量	~50%
`q4_k_s` / `q4_k_m`	4-bit	中	改进的 4-bit，质量更好	~50%
`q5_0` / `q5_1`	5-bit	低	较高质量要求	~40%
`q5_k_s` / `q5_k_m`	5-bit	低	改进的 5-bit	~40%
`q6_k`	6-bit	很低	接近原始质量	~35%
`q8_0`	8-bit	极低	几乎无损，文件较大	~25%
`f16`	16-bit	无	原始转换，未量化	0%

K-quant 说明：
后缀带 _k 的（如 q4_k_m）使用改进的量化算法
混合量化策略：对 attention 层使用更高精度，其他层使用较低精度
_s（small）、_m（medium）、_l（large）表示混合程度

Flutter 组件 ews 的适配鸿蒙Harmony 实战 - 驾驭企业级 Exchange Web Services 协议、实现鸿蒙端政企办公同步与高安通讯隔离方案

欢迎加入开源鸿蒙跨平台社区：https://openharmonycrossplatform.ZEEKLOG.net Flutter 组件 ews 的适配鸿蒙Harmony 实战 - 驾驭企业级 Exchange Web Services 协议、实现鸿蒙端政企办公同步与高安通讯隔离方案前言在鸿蒙（OpenHarmony）生态进军政企办公领域的过程中，与现有企业信息化基础设施的深度集成是一道必答题。即便是在全连接、分布式的今天，微软的 Exchange 服务器依然是全球无数大厂与政务系统处理邮件、日历同步的核心底座。对于习惯了简单 http.get 的移动开发者来说，Exchange Web Services（EWS）协议由于其复杂的 SOAP 封装、繁琐的 XML 数据结构以及极其严苛的身份认证机制，往往是一块难啃的“骨头”。 ews 库为 Dart 提供了成熟的、类型安全的

前端微前端架构：大项目的救命稻草还是自找麻烦？

前端微前端架构：大项目的救命稻草还是自找麻烦？毒舌时刻微前端？听起来就像是一群前端工程师为了显得自己很高级，特意发明的复杂术语。不就是把一个大应用拆成几个小应用嘛，至于搞得这么玄乎吗？你以为拆成微前端就能解决所有问题？别做梦了！到时候你会发现，调试变得更麻烦了，部署变得更复杂了，甚至连样式都可能互相冲突。为什么你需要这个 1. 大型应用的可维护性：当你的应用变得越来越大，单靠一个团队已经无法高效维护时，微前端可以让不同团队独立开发和部署各自的模块。 2. 技术栈的灵活性：不同的微前端可以使用不同的技术栈，比如一个模块用React，另一个模块用Vue，这样可以根据团队的专长选择最合适的技术。 3. 独立部署：微前端可以独立部署，不需要整个应用一起发布，这样可以减少发布风险，加快发布速度。 4. 团队协作：不同团队可以独立开发各自的微前端，减少代码冲突和沟通成本。反面教材 // 这是一个典型的单体应用结构 import React from 'react'; import ReactDOM from 'react-dom'

MaxKB 新手保姆级教程：从零到一，亲手搭建你的专属 AI 知识库助手

你是否曾想过，能拥有一个只回答你自己领域知识的 AI 聊天机器人？一个能 7x24 小时为客户解答产品问题、为公司员工提供内部资料查询的智能客服？MaxKB 就是这样一款强大且开源的工具，它能帮助你轻松实现这个想法。本文是一篇面向新手的、极其详尽的指南。将手把手带你完成 MaxKB 的安装、配置，并深入讲解如何创建和优化你的知识库，最后还将详细拆解其最强大的“高级应用”功能，让你真正掌握这个利器。一、安装 MaxKB：三步搞定，小白也能行对于新手而言，服务器环境配置往往是第一道坎。别担心，我们选用宝塔面板来简化一切操作。 1. 2. 执行安装命令 Docker 环境就绪后，点击面板左侧的终端，这会打开一个命令输入窗口。复制以下这行命令，粘贴进去，然后按下回车键。准备 Docker 环境登录你的宝塔面板，在左侧菜单栏中找到并点击 docker。如果你是第一次使用，系统会提示你安装

Flutter Web 混合开发：构建跨平台 Web 应用

Flutter Web 混合开发：构建跨平台 Web 应用代码如诗，Web 如画。让我们用 Flutter Web 的强大能力，构建出既美观又高性能的跨平台 Web 应用。什么是 Flutter Web？ Flutter Web 是 Flutter 框架的 Web 支持，它允许开发者使用 Flutter 的 UI 框架和 Dart 语言来构建 Web 应用。Flutter Web 将 Dart 代码编译为 JavaScript，使其能够在浏览器中运行。 Flutter Web 的优势 1. 单一代码库：一套代码可以同时构建 Web、移动端和桌面端应用。

概述

Read more

Flutter 组件 ews 的适配 鸿蒙Harmony 实战 - 驾驭企业级 Exchange Web Services 协议、实现鸿蒙端政企办公同步与高安通讯隔离方案

前端微前端架构：大项目的救命稻草还是自找麻烦？

MaxKB 新手保姆级教程：从零到一，亲手搭建你的专属 AI 知识库助手

Flutter Web 混合开发：构建跨平台 Web 应用

Flutter 组件 ews 的适配鸿蒙Harmony 实战 - 驾驭企业级 Exchange Web Services 协议、实现鸿蒙端政企办公同步与高安通讯隔离方案