ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

DeepSeek本地部署:Ollama与AnythingLLM打造私有知识库

DeepSeek本地部署:Ollama与AnythingLLM打造私有知识库 简介面向AI初学者与本地部署爱好者的DeepSeek完整落地教程以保姆级方式讲解从零开始在个人电脑上部署DeepSeek、配置WebUI可视化界面并借助nomic-embed-text与AnythingLLM完成数据投喂训练。资源为单一docx文档共1个文件压缩包大小2.76MB内容按本地部署、WebUI可视化、数据投喂训练三大模块展开包含Ollama安装与模型选型、Page Assist插件配置、AnythingLLM工作区搭建及知识库嵌入等关键环节步骤清晰且附有命令行示例与界面操作说明即使无AI基础也能按图索骥。目前已有1186人学习下载适合希望摆脱官方服务不稳定、追求本地运行与个性化知识库的玩家收藏使用。1. DeepSeek 本地部署与其在网页端排队不如把它装进自己的机器最近 DeepSeek 的热度不用我多说了网页端动不动就是“服务器繁忙”高峰时段一个问句要转半天才出结果。其实 DeepSeek 是开源模型完全可以在本地部署大语言模型把对话、知识库、训练数据全部攥在自己手里。这篇文章要把整条链路拆开讲清楚用 Ollama 部署 DeepSeek-R1、用 Page Assist 做 WebUI 可视化再用 AnythingLLM 配合 nomic-embed-text 做数据投喂训练 AI。整个过程不涉及改代码、不需要懂 Transformer 原理只要你有一台 Windows 电脑跟着步骤走就能拿到一个随时能对话、还能查看并回答自己私有文档内容的专属大模型。这也是近两个月我帮朋友和同事搭了七八套之后整理出来的一条最稳的路径。2. 从零装好 Ollama 并拉取 DeepSeek-R1命令、选型与显存边界2.1 为什么先装 Ollama本地大模型运行时的角色拆解大模型不是一个安装包双击就能跑的。它下载下来是几十 GB 的权重文件运行时要加载到显存、做推理、管理上下文长度这些工作如果让你手动做得配置 Python 环境、下载 PyTorch、写推理脚本新手基本劝退。Ollama 做的事就是把“下载模型、加载模型、运行模型”这三件事封装成一条命令它底层调用 llama.cpp 这类推理引擎对外只暴露一个简洁的 CLI 和本地 HTTP API。你只要装好 Ollama之后无论是用命令行直接对话还是让 WebUI、知识库工具通过接口调用模型都由它统一托管省掉大量环境折腾。我一般会把它理解为“本地大模型的 Docker”你不用关心权重文件放在哪个目录、CUDA 版本对不对、模型量化格式是什么Ollama 全包了。说个选型理由目前本地部署大语言模型的方案不少有写 Python 脚本直接调 transformers 的有用 vLLM 做高性能推理的但新手最稳的路径就是 Ollama。它对 Windows 支持好、显存不足时会自动退到 CPU 推理慢而已官方模型库一行命令就能拉模型而且用户基数大出问题随便一搜就是别人的踩坑记录不用你一个人对着黑匣子发愁。2.2 安装与验证三步确认环境没问题到 Ollama 官网 https://ollama.com 下载 Windows 安装包安装过程没什么可选的一路下一步就行。安装完成后打开 Windows 自带的命令行工具cmd 或 PowerShell输入# 验证 Ollama 是否安装成功 ollama --version正常情况下会输出类似ollama version 0.x.x的版本号。如果提示“不是内部或外部命令”说明安装路径没加进系统环境变量 PATH重新开一个终端窗口再试还不行就找到 Ollama 的安装目录默认在C:\Users\你的用户名\AppData\Local\Programs\Ollama手动把这个路径加进系统环境变量。Ollama 安装好之后默认在本机监听11434端口这个信息后面配置 Page Assist 和 AnythingLLM 都要用。想确认服务真的在跑浏览器访问http://localhost:11434能看到一行Ollama is running的提示就代表正常。提示Ollama 默认监听 11434 端口后续 WebUI 和知识库工具都通过这个端口与模型通信如果哪一步连不上模型先回来看这个端口通不通。2.3 按显存选 DeepSeek 版本1.5b 到 671b 的取舍Ollama 装好后下一步是选模型版本。DeepSeek-R1 系列从 1.5b 一直到 671b参数量差了几百倍显存需求也天差地别。你可以在 Ollama 官网的 Models 页面找到 DeepSeek-R1 模型详情它会列出每个 tag 对应的参数量和推荐显存。我的选型经验是这样4GB-6GB 显存老老实实选 1.5b8GB 显存可以试 7b16GB 以上再考虑 14b 或 32b至于 671b 满血版那是多卡服务器的事普通 PC 不用想。这里的 bbillion指参数量参数量越大模型推理时占用显存越高回答质量也相对越好。本地部署的核心矛盾永远是“你的硬件能跑得起多大的模型”。我自己用的是 4GB 显存的 Windows 笔记本所以全程以 1.5b 版本为基准写操作步骤。下面这张表是我常用的参考模型版本参数量建议显存典型用途deepseek-r1:1.5b1.5B4GB 以上简单对话、文本分类、文档问答deepseek-r1:7b7B8GB - 12GB日常问答、代码片段生成deepseek-r1:14b14B16GB 以上较复杂推理、长文本理解deepseek-r1:32b32B24GB 以上高质量问答、知识库分析deepseek-r1:671b671B多卡服务器满血版本地几乎不看注意表里的显存建议是“模型全量加载到 GPU”的情况。如果显存不够Ollama 会自动把部分层放到 CPU 上跑也能出结果但速度会明显下降后面避坑章节我会详细说这个现象的典型表现。2.4 拉取 DeepSeek-R1 模型并完成首次命令行对话决定好版本之后直接复制 Ollama 页面上的模型名在命令行执行拉取命令# 拉取 1.5b 版本对应原文中 4GB 显存的例子 ollama pull deepseek-r1:1.5b显存更大就改成deepseek-r1:7b或deepseek-r1:14bpull命令不区分模型大小只是下载的数据量不同。下载过程中看不到百分比进度条是正常的它只会显示连接状态耐心等即可。如果不小心关掉了窗口重新执行一次ollama pull会从断点继续不用从头拉。下载完成后直接执行# 进入交互式对话模式 ollama run deepseek-r1:1.5b这个命令会进入一个命令行聊天界面你输入一句它回一句行为和网页端 DeepSeek 类似只是没有图形界面。第一次运行需要加载模型4GB 显存跑 1.5b 大概 5 到 10 秒出结果速度可以接受。确认能对话之后命令行这一层就算跑通了接下来加 WebUI。3. WebUI 可视化用 Page Assist 给 DeepSeek 装一个浏览器界面3.1 命令行交互的痛点与 WebUI 选型命令行能跑通但这离“好用”还差得远。ollama run这种交互方式有几个明显问题第一没有对话历史列表对话一长就翻不到前面的内容第二不直观想引用一张图或一段网页内容都做不到第三日常用很别扭每句话都得在终端里敲。所以我建议加一层 WebUI。目前社区里最常见的两个方案是 Open WebUI 和 Page Assist。Open WebUI 功能很强但需要 Docker 或 Python 环境安装门槛略高Page Assist 是浏览器插件直接从 Chrome/Edge 扩展商店装代码仓库在 https://github.com/n4ze3m/page-assist面向的就是 Ollama 这类本地推理引擎。装好后能在浏览器侧边栏里和本地模型对话还能读取当前网页内容、和 PDF 对话对大部分开发者来说功能密度足够覆盖日常需求了。我之所以推荐 Page Assist核心原因是它不需要额外起服务不用配端口、不用管 Docker 容器一个插件解决可视化诉求非常适合新手。3.2 安装 Page Assist 并接入 Ollama操作路径打开 Chrome 或 Edge 浏览器进入扩展管理页面地址栏输入edge://extensions或chrome://extensions搜索 Page Assist点击获取安装。装完扩展列表里会出现 Page Assist 的图标点击图标打开侧边栏对话界面。打开之后页面上有模型选择下拉框。如果里面没有 DeepSeek 模型检查两件事一是确认 Ollama 服务在运行二是确认模型已经下载成功。Page Assist 通过 Ollama 的本地 API 自动发现已安装模型正常情况下列表里会直接出现deepseek-r1:1.5b。选择模型后直接输入问题即可对话。本质上是 Page Assist 把浏览器里的对话请求转发给 Ollama 的http://localhost:11434/api/chat接口模型推理完再把结果渲染到侧边栏。整个链路里没有远程服务器参与所有对话都在本机完成。这里有个值得注意的细节如果 Page Assist 连不上本地服务去 Ollama 的环境变量里检查一下OLLAMA_HOST是否被改过默认应该是127.0.0.1:11434。3.3 联网开关与视觉支持的边界Page Assist 的侧边栏下方有一个“联网”开关打开后它会把当前网页的内容作为上下文一并交给本地模型再让模型结合网页内容回答。我建议这样用搜索类任务打开联网让模型先读当前页面再做总结纯知识问答保持关闭即可这样响应更快也更稳定。需要说清楚的一点联网开关并没有让 DeepSeek 真正“上网”只是让模型多了一个网页内容来源。DeepSeek-R1 的训练数据有截止时间点对于之后的新信息唯一能让它“知道”的办法就是把内容喂给它——无论是开 Page Assist 的联网开关还是后面 AnythingLLM 的数据投喂本质都是给模型看它没见过的资料。另外Page Assist 支持视觉模型但 DeepSeek-R1 文本版不支持图片输入。如果你想用截图识别、图片问答这类能力需要额外拉一个支持视觉的模型比如llava或qwen2-vl。这个属于进阶玩法新手先把文本链路跑通后面有需求再补。4. 数据投喂训练 AIAnythingLLM 与 nomic-embed-text 搭建私有知识库4.1 方案链路拆解为什么一定要嵌入模型“数据投喂训练 AI”这个词其实容易让人误解。严格来说接下来做的不是改模型权重不是重新训练而是把文档切块、向量化、存进向量数据库在问答时检索最相关的文本片段把片段作为上下文交给大模型让它基于你的私有资料回答。这套方案的专业叫法是 RAG检索增强生成对新手最友好因为它不需要额外训练、不需要改权重却能实现“AI 能看懂我的文档”的效果。在这条链路里nomic-embed-text 扮演的角色是“把文本变成向量”的嵌入模型。文档投喂进系统时每段文字都要统一编码成一组数字向量这样才能计算相似度、才能被检索出来。AnythingLLM 本身不内置嵌入模型它通过 Ollama 调用 nomic-embed-text 完成文档向量化。这也是为什么在执行数据投喂之前要先ollama pull nomic-embed-text。4.2 拉取嵌入模型并安装 AnythingLLM先执行命令拉取嵌入模型# 拉取 nomic-embed-text 嵌入模型 ollama pull nomic-embed-text这个模型很小几百 MB下载很快。嵌入模型和对话模型是两类角色对话模型负责“生成回答”嵌入模型负责“理解并向量化文本”两者缺一不可。拉取完之后去 AnythingLLM 官网下载对应 Windows 版本的安装包。安装过程中有一个细节默认安装路径在 C 盘可以在向导里把路径首字母改成其他盘符比如F:\AnythingLLM避免把模型数据和应用全堆在系统盘。安装完打开软件首次启动有个引导界面点击 Get started然后输入工作区名称。工作区相当于一个独立的项目空间每个工作区可以投喂不同数据集、指定不同模型互不干扰。之后进入主界面如果显示英文点左下角设置Settings在 Customization 里把语言切换成 Chinese重启软件生效。4.3 三处关键配置LLM、Embedder 与代理AnythingLLM 的主界面需要配置三层每一层都指向 Ollama 提供的本地服务。第一层是全局 LLM 设置进入“设置” - “LLM 首选项”提供商选OllamaOllama Model 选择下载好的deepseek-r1:1.5b保存更改。含义是所有对话默认用这个模型推理。第二层是 Embedder 设置在“Embedder 首选项”里提供商选Ollama嵌入模型选nomic-embed-text保存。第三层是工作区级别的模型覆盖在工作区设置里选“聊天设置”把工作区 LLM 提供者、聊天模型都设为 Ollama 和 deepseek-r1点 Update workspace agent代理配置同样指向 Ollama 和 deepseek-r1。这层的意义是让每个工作区可以独立覆盖全局设定多个项目的数据不会串味。不配置代理模型一般不影响基本对话但 AnythingLLM 的 Agent 功能也就是让 AI 执行多步操作、调用工具的能力依赖这个字段。建议新人一并配齐省得后面要用时再回来补。4.4 上传文档与向量化投喂完整操作步骤配置完成后回到工作区主界面点“上传”按钮选择需要投喂的文档。AnythingLLM 支持 PDF、TXT、Word、Excel、PPT 等常见格式文本类文件基本通吃。文件上传后会出现在临时文件列表里勾选要投喂的文件点击 Move to Workspace 把文件移入当前工作区然后再点 Save and Embed 执行向量化。所谓 Embed就是把文档切块并调用 nomic-embed-text 生成向量存入 AnythingLLM 自带的向量数据库。这一步就是“数据投喂训练 AI”的字面执行。执行完之后关掉文档窗口直接在对话框提问。如果你问的问题在文档里有明确答案AnythingLLM 会先检索相关片段再把片段拼进 prompt 交给 deepseek-r1 生成回答。这套方案的边界是它擅长回答文档中有原文依据的问题文档里没提到的内容模型会退化回自己的常识回答甚至明确告诉你不知道。这不算缺陷反而是 RAG 方案的安全边界防止模型把知识库之外的内容编造出来。5. 避坑与排查从“拉不下来”到“答非所问”的五条实战记录5.1 现象ollama pull卡住不动提示网络错误原因Ollama 拉取模型走的是官方模型仓库国内网络访问时链路不稳定尤其在大模型下载过程中经常中断。解决我的习惯分三步。第一步重新执行ollama pullOllama 支持断点续传多试几次经常能拉完第二步如果反复失败检查 Ollama 的环境变量看是否配置了OLLAMA_MODELS指向的模型存储路径有足够磁盘空间同时可以在 Ollama 官方文档里查询镜像仓库配置方式换一个访问更快的镜像源第三步实在不行换个网络环境比如手机热点拉通之后再切回原网络。这个坑基本每个新手都会遇到是网络环境问题不是配置错误不用反复怀疑自己。5.2 现象模型加载成功但回答速度极慢一个字一个字往外蹦原因显存不够Ollama 自动把部分层放到了 CPU 上推理。4GB 显存跑 7b 就是这种体验能出结果但基本没法用。解决回到选型环节把模型换成deepseek-r1:1.5b或者关掉其他占用显存的软件浏览器多开标签页也会吃显存再或者把 Ollama 的并行参数OLLAMA_NUM_PARALLEL设置为 1减少并发任务对显存的占用。我自己的测试里4GB 显存跑 1.5b 流畅对话跑 7b 基本不可用所以在选版本这件事上宁小勿大先跑通再升级。5.3 现象文档投喂完之后提问时 AI 还是回答不上来原因常见有三种。第一种投喂后没点 Save and Embed文档只是上传了没做向量化检索不到内容第二种提问的措辞和文档原文差异太大嵌入检索匹配不上第三种对话界面选错了工作区当前工作区里根本没有投喂数据。解决重新确认上传流程三步都执行完毕特别是最后的 Save and Embed提问时尽量用文档里的原词比如文档写的是“正点原子”你问“这家公司是做什么的”能答出来但换一个完全不同的说法可能就匹配不上最后确认对话界面对应的就是投喂数据的工作区。5.4 现象Page Assist 打开联网开关后回答质量反而变差原因联网后模型收到了当前网页的大段无关文本作为上下文这些干扰文本冲淡了模型对问题的理解回答自然跑偏。解决联网开关保持关闭只在需要总结当前网页内容时开启。页面内容过长时手动复制关键段落投喂给模型效果比让模型读全文好得多。这里有个经验RAG 的关键不是给更多内容而是给更相关的内容。5.5 现象AnythingLLM 界面全英文找不到中文选项原因语言选项藏在 Customization 外观定制菜单里而不是 Settings 首页新用户容易忽略。解决进入 Settings - Customization找到 Language 或语言下拉框选择 Chinese保存后重启 AnythingLLM。如果你的版本里连这个选项都没有确认安装的是最新版旧版本对中文界面支持不完整。6. 验证投喂成果与两条进阶玩法把 AI 变成团队的文档库验证整套本地部署值不值得关键看你能不能从“能对话”走到“能用”。我自己验证投喂效果的方式很简单问一个只有文档里才有的答案。比如投喂的是公司介绍文档里面有句“正点原子成立于某年某地”我就问“正点原子公司成立于哪一年、在哪个城市”。如果 AI 能准确回复出来说明嵌入、检索、生成这条链路全通了如果回得不对回到上一章的 5.3 逐项排查。进阶玩法第一个是多工作区隔离。AnythingLLM 支持每个工作区独立投喂数据、独立选模型我一般每个项目开一个工作区项目 A 的合同文本放工作区 A项目 B 的技术手册放工作区 B两边提问互不干扰。这个做法对团队协作特别实用相当于给每个项目建了一个独立的私有知识库。第二个进阶玩法是把 Ollama 的能力接进自己的脚本。Ollama 在 11434 端口提供 OpenAI 兼容 APIAnythingLLM 之外的代码也能直接调用。比如用 Python 的ollama库或 Node 的ollama/ollama-js在脚本里封装对话请求把本地模型嵌入到业务流程中。我做一个日报自动生成工具时就是这么干的脚本读取项目文档调用本地deepseek-r1:1.5b生成摘要再写入 Excel全程不出本机不产生任何 API 费用。从那以后我每次帮人部署本地大模型都强制走一遍“装 Ollama - 拉模型 - 接 WebUI - 建工作区 - 投喂测试文档”的完整流程。这套流程看着长跑熟了一次不到二十分钟但能确保每一层环境都是通的而不是只在命令行里能回话。希望这篇教程里的链路和坑位记录能帮到你特别是第一次碰本地大模型的朋友按着文档一步步来大概率不会再翻车。本文还有配套的精品资源点击获取
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进