【大模型知识】Chroma + Ollama + Llama 3.1 搭建本地知识库

优质文章学习记录

08 Apr 2026 — 5 min read

搭建本地知识库

✅ 一、整体架构设计（RAG + 向量检索 + 本地 LLM）
🧰 二、推荐技术栈（2026 年最佳实践）
🛠️ 三、具体搭建步骤（以 Chroma + Ollama + Llama 3.1 为例）
🔒 四、安全与性能优化建议
🧪 五、验证知识库效果
- 测试用例：
📦 六、进阶扩展方向
✅ 总结：你的本地知识库技术栈

作为大模型开发人员，搭建一套 本地私有知识库系统（Local RAG Pipeline）是提升 AI 助手专业性、保障数据安全、避免幻觉的关键基础设施。以下是一套 经过生产验证、开源免费、支持中文、可扩展性强的技术栈方案与详细搭建步骤。

✅ 一、整体架构设计（RAG + 向量检索 + 本地 LLM）

原始文档
（PDF/Word/TXT/Markdown）

文档解析 & 分块

向量化
（Embedding）

向量数据库

大模型 Agent

LLM 推理引擎
（本地运行）

用户问答

🧰 二、推荐技术栈（2026 年最佳实践）

组件	推荐方案	选择理由
文档解析	`Unstructured` + `PyPDF2` / `docx2txt`	支持 PDF/Word/PPT/HTML，保留表格结构
文本分块	`LangChain` RecursiveCharacterTextSplitter	智能按段落/句子切分，避免语义割裂
嵌入模型（Embedding）	BAAI/bge-large-zh-v1.5（中文）或 nomic-ai/nomic-embed-text-v1.5（多语言）	中文 SOTA，4096 上下文，HuggingFace 开源
向量数据库	ChromaDB（轻量）或 Qdrant（高性能）	Chroma：单机文件存储，零配置Qdrant：支持过滤、分布式，适合未来扩展
大模型推理	Ollama + Llama 3.1 8B/70B或 vLLM（高吞吐）	Ollama：一键启动，API 兼容 OpenAIvLLM：PagedAttention，吞吐提升 24x
应用框架	LangChain 或 LlamaIndex	LangChain：生态丰富，调试工具完善

💡 为什么不用 Elasticsearch？
虽然 ES 支持向量检索（≥8.0），但配置复杂、资源占用高。Chroma/Qdrant 专为 embedding 设计，更轻量高效。

🛠️ 三、具体搭建步骤（以 Chroma + Ollama + Llama 3.1 为例）

步骤 1：安装基础环境

# 安装 Python ≥3.10sudoaptinstall python3-pip # 安装 Ollama（自动下载 Llama 3）curl -fsSL https://ollama.com/install.sh |sh# 启动 Ollama 服务（后台运行） ollama serve &

步骤 2：安装 Python 依赖

pip install langchain chromadb unstructured PyPDF2 python-docx sentence-transformers

步骤 3：准备知识文档

将你的知识文件放入 ./docs/ 目录，支持：

.pdf, .docx, .txt, .md, .html

步骤 4：构建向量知识库（Python 脚本）

创建 build_kb.py：

from langchain.document_loaders import DirectoryLoader from langchain.text_splitter import RecursiveCharacterTextSplitter from langchain.embeddings import HuggingFaceEmbeddings from langchain.vectorstores import Chroma import os # 1. 加载文档 loader = DirectoryLoader('./docs', glob="**/*.pdf", show_progress=True) docs = loader.load()# 2. 文本分块（按字符递归切分） text_splitter = RecursiveCharacterTextSplitter( chunk_size=500, chunk_overlap=50, separators=["\n\n","\n","。","！","？","；"," ",""]) chunks = text_splitter.split_documents(docs)# 3. 加载中文 Embedding 模型（首次运行会自动下载 ~1.3GB） embeddings = HuggingFaceEmbeddings( model_name="BAAI/bge-large-zh-v1.5", model_kwargs={'device':'cuda'}# 若无 GPU 改为 'cpu')# 4. 存入 Chroma 向量库（持久化到 ./chroma_db） vectorstore = Chroma.from_documents( documents=chunks, embedding=embeddings, persist_directory="./chroma_db") vectorstore.persist()print(f"✅ 知识库构建完成！共 {len(chunks)} 个片段")

运行：

python build_kb.py

⏱️ 首次运行需下载模型（约 10–30 分钟），后续秒级加载。

步骤 5：启动问答服务（RAG 推理）

创建 query_kb.py：

from langchain.vectorstores import Chroma from langchain.embeddings import HuggingFaceEmbeddings from langchain.llms import Ollama from langchain.chains import RetrievalQA # 加载向量库 embeddings = HuggingFaceEmbeddings(model_name="BAAI/bge-large-zh-v1.5") vectorstore = Chroma(persist_directory="./chroma_db", embedding_function=embeddings)# 初始化本地 LLM（Ollama 需提前 pull 模型） llm = Ollama(model="llama3:8b", temperature=0.1)# 构建 RAG 链 qa_chain = RetrievalQA.from_chain_type( llm=llm, retriever=vectorstore.as_retriever(search_kwargs={"k":3}), return_source_documents=True)# 问答循环whileTrue: query =input("\n❓ 请输入问题（输入 'quit' 退出）: ")if query =="quit":break result = qa_chain({"query": query})print(f"\n💡 回答:\n{result['result']}")# 显示引用来源print("\n📚 参考片段:")for i, doc inenumerate(result["source_documents"]):print(f"[{i+1}] {doc.page_content[:100]}...")

首次运行前，拉取 Llama 3 模型：

ollama pull llama3:8b # 或 llama3:70b（需 48GB+ 内存）

运行问答：

python query_kb.py

🔒 四、安全与性能优化建议

1. 隐私保护

所有数据仅在本地处理，不上传任何云服务
向量库文件（./chroma_db）可加密存储（如使用 gocryptfs）

2. 性能调优

场景	优化方案
GPU 资源充足	使用 `vLLM` 替代 Ollama：`pip install vllm` + `--model meta-llama/Llama-3.1-8B-Instruct`
大文档集（>10万页）	改用 Qdrant：`docker run -p 6333:6333 qdrant/qdrant`
低延迟要求	将 Embedding 模型转为 ONNX 格式（提速 2–3x）

3. 中文增强

在 text_splitter 的 separators 中加入中文标点（已包含）
使用 BGE-M3 模型（支持多语言+稀疏检索，2024 新 SOTA）

🧪 五、验证知识库效果

测试用例：

拒答能力

“公司的股票代码是多少？”（若文档未提及）
→ 应回答“知识库中未找到相关信息”

跨文档推理

“对比A产品和B产品的技术参数”
→ 应聚合多个文档信息

事实性问题

“根据文档，公司2025年战略目标是什么？”
→ 应准确引用原文片段

📦 六、进阶扩展方向

需求	方案
Web 界面	集成 `Gradio` 或 `Streamlit`
自动更新	监听 `./docs` 目录变动，增量更新向量库
多模态支持	用 `Donut` 解析 PDF 表格，转为结构化文本
Agent 能力	接入 `LangGraph` 实现多跳推理

✅ 总结：你的本地知识库技术栈

组件	选用方案	启动命令
LLM	Ollama + Llama 3.1 8B	`ollama run llama3:8b`
Embedding	BAAI/bge-large-zh-v1.5	自动加载
向量库	ChromaDB	`./chroma_db` 文件夹
框架	LangChain	`pip install langchain`

💡 总耗时：环境搭建 < 30 分钟，知识库构建速度 ≈ 100 页/分钟（RTX 4090）。

DooTask升级指南：解锁AI新功能，一键办公

DooTask升级指南：解锁AI新功能，一键办公 DooTask 本次升级围绕认证安全、AI 增强、功能扩展与用户体验四大维度，带来 20 + 项核心优化。新增 AI 助手功能，可生成消息、项目计划和任务，提升协作效率；收藏功能全面扩展，支持消息、文件和项目收藏，优化状态切换逻辑；新增文件游客访问权限，保障文件安全与隐私；支持应用列表导出，方便数据管理；还有任务浏览历史功能，便于回顾和管理任务。此次升级旨在为用户提供更高效、便捷、安全的团队协作体验。为进一步提升团队协作效率与智能化水平，DooTask围绕认证安全、AI 增强、功能扩展与用户体验四大维度进行全面升级。本次更新包含 20+ 项核心优化，涵盖从底层逻辑重构到前端交互创新的突破性改进。以下是本次升级的详细亮点：新增功能：开启团队协作新篇章 AI 助手全面赋能本次升级为 DooTask 注入了强大的 AI 力量，带来了多项基于

AI 编剧 × 导演思维工具全景指南（2025）

摘要：本文系统梳理了当前 AI 辅助影视创作领域的主流工具与开源项目，涵盖故事结构搭建、角色管理、对话生成、分镜预可视化、镜头运动控制、视频 Agent 框架六大维度，重点收录 GitHub 开源项目，兼顾商业工具与国内平台，适合编剧、导演、短剧创作者及影视 AI 研究者参考。一、为什么要把编剧和导演分开讲很多人把"AI 写剧本"和"AI 拍视频"混为一谈，但这两件事在思维层面是截然不同的。编剧思维关心的是"写什么"：故事结构、人物弧线、情节逻辑、台词张力。它的输出是文字，是剧本，是一套叙事方案。导演思维关心的是"怎么拍"

Flutter 组件 google_generative_language_api 适配鸿蒙 HarmonyOS 实战：生成式 AI 集成，构建大语言模型调度与全场景智能推理治理架构

欢迎加入开源鸿蒙跨平台社区：https://openharmonycrossplatform.ZEEKLOG.net Flutter 组件 google_generative_language_api 适配鸿蒙 HarmonyOS 实战：生成式 AI 集成，构建大语言模型调度与全场景智能推理治理架构前言在鸿蒙（OpenHarmony）生态迈向全场景 AI 赋能、涉及高效的语义理解、自动化内容生成及严苛的端云协同智能隐私保护背景下，如何实现一套既能深度对接 Google 生成式语言模型（如 Gemini、PaLM）、又能保障异步请求高响应性且具备多模态输入处理能力的“AI 调度中枢”，已成为决定应用智能化水平与用户体验代差的关键。在鸿蒙设备这类强调分布式协同与端侧算力按需分配的环境下，如果应用依然采用低效的 REST 手写拼接，由于由于 payload 结构复杂性，极易由于由于“协议解析异常”导致鸿蒙应用在大模型推理环节发生由于由于由于由于通讯阻塞。我们需要一种能够统一模型调用语义、支持流式（Streaming）响应且符合鸿蒙异步异步并发范式的

AI股票分析师daily_stock_analysis一键部署教程：Python爬虫数据采集实战

AI股票分析师daily_stock_analysis一键部署教程：Python爬虫数据采集实战你是不是也厌倦了每天手动盯盘，在几十个股票软件和财经新闻网站之间来回切换？想不想拥有一个24小时在线的AI分析师，帮你自动抓取数据、分析行情，还能把分析报告直接推送到你的手机上？今天，我就带你手把手搭建一个属于自己的AI股票分析系统。这个系统叫daily_stock_analysis，是一个在GitHub上非常火的开源项目。它最大的特点就是“全自动”和“零成本”——利用免费的云端资源和AI大模型，帮你把繁琐的复盘工作自动化。听起来有点复杂？别担心，这篇教程就是写给新手看的。我会用最直白的话，一步步教你如何在星图GPU平台上把它跑起来，并且重点讲解如何用Python爬虫技术，为这个系统注入“活水”——也就是自动采集股票数据。整个过程就像搭积木，跟着我做，你也能拥有一个专属的智能投研助理。 1. 准备工作：认识你的AI分析师在动手之前，我们先花几分钟了解一下我们要部署的这个“家伙”到底能干什么。这样你才知道自己即将拥有一个什么样的工具。 daily_stock_anal