openclaw使用llama.cpp 本地大模型部署教程

优质文章学习记录

07 Apr 2026 — 4 min read

openclaw使用llama.cpp 本地大模型部署教程

本教程基于实际操作整理，适用于 Windows WSL2 环境

全程使用 openclaw 帮我搭建大模型

一、环境准备

1. 硬件要求

显卡	推荐模型	显存占用
GTX 1050 Ti (4GB)	Qwen2.5-3B Q4	~2.5GB
RTX 4060 (8GB)	Qwen2.5-7B Q4	~5GB
RTX 4090 (24GB)	Qwen2.5-32B Q4	~20GB

2. 安装编译工具（WSL Ubuntu）

sudoapt update sudoaptinstall -y cmake build-essential

二、下载和编译 llama.cpp

1. 克隆源码

mkdir -p ~/llama.cpp cd ~/llama.cpp git clone --depth 1 https://github.com/ggerganov/llama.cpp.git src

2. 编译

cd ~/llama.cpp/src mkdir build &&cd build cmake .. -DCMAKE_BUILD_TYPE=Release make -j$(nproc) llama-cli llama-server

编译完成后，可执行文件在 ~/llama.cpp/src/build/bin/ 目录下。

三、下载模型

1. 创建模型目录

mkdir -p ~/llama.cpp/models

2. 下载 GGUF 模型（使用国内镜像加速）

Qwen2.5-3B（适合 4GB 显存）：

curl -L -o ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \"https://hf-mirror.com/Qwen/Qwen2.5-3B-Instruct-GGUF/resolve/main/qwen2.5-3b-instruct-q4_k_m.gguf"

Qwen2.5-7B（适合 8GB 显存）：

curl -L -o ~/llama.cpp/models/qwen2.5-7b-instruct-q4_k_m.gguf \"https://hf-mirror.com/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf"

四、运行模型

方式一：命令行交互模式

cd ~/llama.cpp/src/build/bin ./llama-cli -m ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \ -c 4096\ --no-display-prompt

参数说明：

-m 模型路径
-c 上下文长度（默认 512，建议 4096）
-ngl GPU 层数（纯 CPU 可不加）

方式二：启动 API 服务

cd ~/llama.cpp/src/build/bin ./llama-server \ -m ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \ --host 0.0.0.0 \ --port 8080\ -c 4096

服务启动后访问：http://localhost:8080

五、API 调用方法

API 信息

项目	值
地址	`http://localhost:8080`
API Key	不需要（或随意填写）
兼容格式	OpenAI API

端点列表

端点	说明
`POST /v1/chat/completions`	聊天补全
`POST /v1/completions`	文本补全
`GET /health`	健康检查
`GET /`	Web 聊天界面

调用示例

curl

curl http://localhost:8080/v1/chat/completions \ -H "Content-Type: application/json"\ -d '{ "model": "qwen2.5-3b", "messages": [ {"role": "system", "content": "你是一个有帮助的助手。"}, {"role": "user", "content": "你好，介绍一下你自己"} ], "temperature": 0.7, "max_tokens": 512 }'

Python（OpenAI SDK）

from openai import OpenAI client = OpenAI( base_url="http://localhost:8080/v1", api_key="not-needed") response = client.chat.completions.create( model="qwen2.5-3b", messages=[{"role":"system","content":"你是一个有帮助的助手。"},{"role":"user","content":"你好"}], temperature=0.7, max_tokens=512)print(response.choices[0].message.content)

Node.js

const response =awaitfetch('http://localhost:8080/v1/chat/completions',{method:'POST',headers:{'Content-Type':'application/json'},body:JSON.stringify({model:'qwen2.5-3b',messages:[{role:'user',content:'你好'}]})});const data =await response.json(); console.log(data.choices[0].message.content);

六、常用参数说明

服务端参数（llama-server）

参数	说明	示例
`-m`	模型路径	`-m model.gguf`
`--host`	监听地址	`--host 0.0.0.0`
`--port`	端口	`--port 8080`
`-c`	上下文长度	`-c 4096`
`-ngl`	GPU 层数	`-ngl 99`（全部放 GPU）
`-np`	并行请求数	`-np 4`
`--api-key`	设置 API Key	`--api-key your-key`

API 请求参数

参数	说明	默认值
`temperature`	随机性（0-2）	0.7
`max_tokens`	最大生成长度	模型上限
`top_p`	核采样	1.0
`stream`	流式输出	false
`stop`	停止词	[]

七、常见问题

Q1: 报错 “CUDA out of memory”

减少 -ngl 数值，让部分层用 CPU 计算：

./llama-server -m model.gguf -ngl 20# 只放 20 层到 GPU

Q2: 中文乱码

PowerShell 执行：

chcp 65001

Q3: 如何后台运行服务？

nohup ./llama-server -m model.gguf --host 0.0.0.0 --port 8080> server.log 2>&1&

Q4: 如何设置 API Key 认证？

./llama-server -m model.gguf --api-key "your-secret-key"

调用时需要带上：

curl -H "Authorization: Bearer your-secret-key"...

Q5: 从其他设备访问

查看 WSL IP：hostname -I
使用该 IP 访问，如 http://172.x.x.x:8080

八、推荐模型

模型	大小	适合场景
Qwen2.5-3B-Instruct Q4	~2GB	轻量对话、低配设备
Qwen2.5-7B-Instruct Q4	~4.5GB	通用对话、代码
Qwen2.5-14B-Instruct Q4	~9GB	复杂推理
DeepSeek-R1-Distill-Qwen-7B Q4	~4.5GB	数学、逻辑推理
Mistral-7B-v0.3 Q5	~5GB	英文、代码

下载地址： https://hf-mirror.com（国内镜像）

九、文件结构

~/llama.cpp/ ├── src/ # llama.cpp 源码 │ └── build/ │ └── bin/ │ ├── llama-cli # 命令行工具 │ └── llama-server # API 服务 └── models/ # 模型存放目录 └── qwen2.5-3b-instruct-q4_k_m.gguf

十、快速启动脚本

创建 start-server.sh：

#!/bin/bashcd ~/llama.cpp/src/build/bin ./llama-server \ -m ~/llama.cpp/models/qwen2.5-3b-instruct-q4_k_m.gguf \ --host 0.0.0.0 \ --port 8080\ -c 4096\ -np 4

赋予执行权限：

chmod +x start-server.sh ./start-server.sh

教程整理于 2026-02-03
基于 llama.cpp b7917 + Qwen2.5-3B-Instruct

人工智能：自然语言处理在医疗领域的应用与实战

人工智能：自然语言处理在医疗领域的应用与实战学习目标 💡 理解自然语言处理（NLP）在医疗领域的应用场景和重要性 💡 掌握医疗领域NLP应用的核心技术（如电子病历分析、医学文本分类、智能问答） 💡 学会使用前沿模型（如BERT、GPT-3）进行医疗文本分析 💡 理解医疗领域的特殊挑战（如数据隐私、多语言处理、专业术语） 💡 通过实战项目，开发一个电子病历分析应用重点内容 * 医疗领域NLP应用的主要场景 * 核心技术（电子病历分析、医学文本分类、智能问答） * 前沿模型（BERT、GPT-3）在医疗领域的使用 * 医疗领域的特殊挑战 * 实战项目：电子病历分析应用开发一、医疗领域NLP应用的主要场景 1.1 电子病历分析 1.1.1 电子病历分析的基本概念电子病历分析是对电子病历中的文本内容进行分析和处理的过程。在医疗领域，电子病历分析的主要应用场景包括： * 病历摘要：自动生成病历摘要（如“患者基本信息”、“病情描述”

AIGC浪潮下，风靡全球的Mcp到底是什么？一文讲懂，技术小白都知道！！

个人主页-爱因斯晨文章专栏-AIGC 长大好多烦恼，好愁！目录前言初步了解 Mcp到底是个啥？发展理论基础核心组件使用逻辑于传统API不同之处模型推荐前言上年这个时候，刚拿到录取通知书。哥哥教我用ai智能体，其实就是向我炫技。当时我问他，为什么不能直接给我生成图表，直接给我生成多好，省得我再去复制了。他说，其实很简单，只要做个接口协议什么的就行，只是目前国内没人做。当时说的很高深，我也听不懂。没想到年底，这个功能就实现内测了。在某种程度上，我也算是预言了哈哈。初步了解 Mcp到底是个啥？ Mcp，全称 Model Context Protocol，翻译过来是模型上下文协议。你不用管这高大上的名字，简单说，它就是和大 AI 模型聊天时，一种把相关信息整理好、按规矩传给 AI 的方式。

AI绘画新选择：对比Stable Diffusion与Z-Image-Turbo的快速搭建方案

AI绘画新选择：对比Stable Diffusion与Z-Image-Turbo的快速搭建方案为什么需要快速切换AI绘画模型？作为一名数字艺术家，我经常需要在不同AI绘画模型之间切换测试效果。传统方式每次都要重新配置环境，不仅耗时耗力，还可能遇到依赖冲突等问题。本文将分享如何通过预置环境快速对比Stable Diffusion和Z-Image-Turbo这两个热门模型。这类任务通常需要GPU环境支持，目前ZEEKLOG算力平台提供了包含这两个模型的预置镜像，可以快速部署验证。下面我会从实际使用角度，带你了解两种模型的特性差异和部署技巧。环境准备与快速启动基础环境要求 * GPU：建议NVIDIA显卡，显存≥8GB（Z-Image-Turbo最低6GB也可运行） * 系统：Linux/Windows WSL2 * 驱动：CUDA 11.7+ 一键启动命令 # 拉取预置镜像（已包含双模型） docker pull ZEEKLOG/ai-painting:sd-zimage # 启动容器（自动挂载输出目录） docker run -it --gpus al

人工智能进化全景：从专用工具到超级智能的跃迁（ANI、AIGC、AGI和ASI）

1. 人工智能的谱系：从ANI到ASI的进化阶梯在人工智能领域，ANI、AIGC、AGI和ASI代表了智能发展的不同阶段和形态。这些概念构成了理解人工智能发展路径的关键框架。 1.1 ANI：专业化智能的时代人工狭义智能（Artificial Narrow Intelligence，ANI）是我们今天生活中无处不在的人工智能形式。这类系统被设计用于在特定、有限范围内执行任务，其特点是高专业性和低泛化能力。 ANI系统已经深入到我们生活的方方面面： * 自然语言处理：如智能客服、语音助手（Siri、Alexa） * 计算机视觉：人脸识别、医学影像分析 * 推荐系统：Netflix的影片推荐、Amazon的购物推荐 * 预测分析：金融风险评估、天气预报模型一个典型的ANI系统架构通常包括数据收集模块、特定算法模型和结果输出模块。以AlphaGo为例，它能够在围棋领域超越人类顶尖选手，却无法将这种能力转移到简单的图像识别任务中。 1.2 AIGC：创造力的觉醒人工智能生成内容（Artificial Intelligence Generated Content

openclaw使用llama.cpp 本地大模型部署教程

一、环境准备

1. 硬件要求

2. 安装编译工具（WSL Ubuntu）

二、下载和编译 llama.cpp

1. 克隆源码

2. 编译

三、下载模型

1. 创建模型目录

2. 下载 GGUF 模型（使用国内镜像加速）

四、运行模型

方式一：命令行交互模式

方式二：启动 API 服务

五、API 调用方法

API 信息

端点列表

调用示例

curl

Python（OpenAI SDK）

Node.js

六、常用参数说明

服务端参数（llama-server）

API 请求参数

七、常见问题

Q1: 报错 “CUDA out of memory”

Q2: 中文乱码

Q3: 如何后台运行服务？

Q4: 如何设置 API Key 认证？

Q5: 从其他设备访问

八、推荐模型

九、文件结构

十、快速启动脚本

Read more

人工智能：自然语言处理在医疗领域的应用与实战

AIGC浪潮下，风靡全球的Mcp到底是什么？一文讲懂，技术小白都知道！！

AI绘画新选择：对比Stable Diffusion与Z-Image-Turbo的快速搭建方案

人工智能进化全景：从专用工具到超级智能的跃迁（ANI、AIGC、AGI和ASI）