
简介面向有一定技术背景、希望在本地完成大模型私有化部署的开发者和研发团队教程以DeepSeek R1本地部署为起点带读者走通Ollama环境搭建、多尺寸模型选择与运行、API密钥配置以及通过Cherry Studio构建企业级私有知识库的完整链路。内容紧扣不同硬件配置给出1.5b至70b版本选型建议并对模型存储路径修改、模型删除管理等易踩坑环节单独说明同时补充了硅基流动性等备用API应对网络异常兼顾安全性与稳定性。教程附带的演示平台、视频课程与智能体实例链接让读者不仅看懂步骤还能直接体验效果。资源为1个docx格式文档容量2.8MB重点清晰、便于按章节查阅。已有16465人学习下载适合正在评估本地化AI落地的个人开发者和企业内部团队参考。1. 想跑 DeepSeek 本地部署先把预期拉到 7B 这个档位很多人一听说 DeepSeek 本地部署就以为能把官方那个 671B 满血版塞进自己电脑。我直接用一台 AMD VEGA 56 老显卡机器实测了一圈结论很直接满血版不是个人电脑能碰的东西真正适合本地的是 R1 蒸馏版从 1.5b 到 70b 都有而 Ollama 就是把这些模型拉下来、用命令行跑起来的核心工具。对纯新手来说Ollama 加 ChatBox 再加 Cherry Studio 这套组合能覆盖「本地跑模型 云端 API 兜底 私有知识库」三件事。这篇文章全程按 Windows 实测流程写同样适合已经在用 Coze 智能体、想把模型接到个人资料库里的从业者。2. Ollama 安装与模型下载版本选择、慢速下载和模型存放路径2.1 为什么选 Ollama 而不是直接上 Python 推理框架常见做法是先装 Python、再配 CUDA、再写加载脚本一套下来新手至少折腾半天而且显卡驱动和依赖库版本稍微不对模型加载直接报错。Ollama 的思路类似 Docker把模型、运行时、依赖都打包好你只需要执行一条ollama run命令它就自动负责下载、加载、推理和上下文管理。支持 macOS、Linux、Windows对只想本地跑起来的人来说这是最省事的一条路。有人会问LM Studio 也有图形界面不是更简单吗LM Studio 更适合单机点点鼠标聊天但要做命令行批量操作、换模型路径、控制模型显存占用Ollama 的灵活度高得多。vLLM 吞吐性能更强但那是给服务端高并发场景用的个人电脑上没必要给自己找麻烦。2.2 Ollama 下载与安装验证安装包从官网下载即可Windows 选择 OllamaSetup.exeGitHub releases 也有备份链接。如果官网下载慢找一份离线安装包也一样用版本对应 0.5.7 即可安装完成后没有任何界面它默认在后台运行。# 验证 Ollama 是否安装成功正常会输出版本号 ollama -v代码里的-v是 version 的意思看到类似0.5.7的输出就说明装好了。接着打开浏览器输入http://localhost:11434/页面显示Ollama is running就表示后台服务已启动。这一步很重要因为后面所有模型操作都依赖这个后台进程。注意Ollama 是后台服务不装任何桌面程序。如果你在任务栏找不到它是正常的不用反复重装。2.3 模型选型对照硬件对号入座DeepSeek R1 官方放出的是蒸馏版系列常见有 1.5b、7b、14b、32b、70b不同参数量的模型对硬件要求差别很大。Ollama 官方页面给的推荐配置是 7b 需要 RTX 3060 以上显卡加 16G 内存70b 则需要 RTX 4090 以上加 32G 内存这是比较实在的参考值。模型版本命令模型大小内存建议适合场景1.5bollama run deepseek-r1:1.5b约 1.1GB8G 以上验证流程、低配机器7bollama run deepseek-r1:7b约 4.7GB16G 以上主流个人部署对标 GPT-3.514bollama run deepseek-r1:14b约 9GB16G 以上效果更好速度下降32bollama run deepseek-r1:32b约 20GB32G 以上追求效果的中高性能机器70bollama run deepseek-r1:70b约 40GB32G 以上接近 GPT-4 的本地体验给新手的建议是先跑 1.5b把从下载到对话的整条链路跑通再根据自己的显卡逐步升级。我在这台 AMD VEGA 56 上直接试 7b下载和加载都正常但推理速度明显比 NVIDIA 卡慢这一点下文专门讲。2.4 下载慢、卡在 pulling 的通用解法很多第一次用 Ollama 的人都会卡在模型下载阶段进度条停在 0% 或者十几 MB 就不动了。模型文件动辄几个 GB下载通道不稳定很容易出现这种问题。我的处理顺序是这样的先区分是安装包慢还是模型慢。安装包慢直接换 GitHub releases 备份链接或者网盘离线包不需要死等官网。模型下载慢耐心等一会儿因为 Ollama 支持断点续传中途退出再重新执行ollama run会接着下载不是从零开始。低峰时段重试成功率也会高一些。注意千万不要看到进度条不动就反复删除重下这样反而浪费之前已经下好的部分。确认网络没断的情况下等 10 到 15 分钟再判断。2.5 修改模型存放路径把 OLLAMA_MODELS 指到 D 盘模型默认存放在C:\Users\你的用户名\.ollama\modelsC 盘空间紧张的人一定要先改路径再下载模型。步骤是右键「此电脑」→ 属性 → 高级系统设置 → 环境变量在系统变量里新建OLLAMA_MODELS变量值填一个空间充足的目录比如D:\OllamaModels。也可以直接用命令行设置# 设置用户级环境变量设置后新启动的进程才会生效 setx OLLAMA_MODELS D:\OllamaModels # 查看当前已拉取的模型列表 ollama listsetx是 Windows 自带的环境变量写入命令它只对之后启动的进程生效所以设置完必须重启 Ollama。最稳妥的办法是打开任务管理器找到所有 Ollama 相关进程全部结束然后重新运行ollama run或者干脆重启系统。验证方法是再次执行ollama list新下载的模型会落到 D 盘。有一点要提醒已经下载到旧路径的模型不会自动迁移需要手动把模型文件夹移动过去再重新执行ollama list确认识别。3. DeepSeek-R1 命令行运行第一次对话、换模型和显卡问题3.1 第一次运行用 1.5b 把流程跑通命令行执行下面这条命令Ollama 会自动判断本地有没有该模型没有就开始下载下载完成后直接进入交互式对话界面# 首次运行会自动下载模型完成后直接进入对话模式 ollama run deepseek-r1:1.5b看到success提示并且出现输入提示符就说明模型已经装好并开始运行了。这里推荐 1.5b 不只是因为它小更重要的是它能快速暴露环境问题。如果连 1.5b 都加载失败说明驱动或环境变量配置有问题这时候去排查大模型就是浪费时间和流量。3.2 对话界面的基础操作进入提示符后直接输入文字就可以和模型聊天。几个常用命令要记牢# 输出帮助菜单查看当前模型支持的指令 /? # 清空当前对话上下文释放部分内存占用 /clear # 退出对话结束模型进程 /bye/?能列出当前模型支持的全部指令不同模型会有些差异。/clear适合对话历史太长、回复变慢时使用。/bye退出后模型会从内存中释放如果后面不打算用了再配合ollama rm删除模型文件释放磁盘空间。3.3 从 1.5b 升到 7b速度和效果怎么权衡7b 模型大约 4.7GB是 R1 系列里平衡得比较好的档位原作者的推荐配置是 RTX 3060 加 16G 内存。如果你手里的机器只是办公本没有独立显卡跑 7b 也能跑但速度会明显低于预期体现在每个 token 生成都要等好几秒。14b 模型接近 9GB同样 16G 内存可以运行但生成速度会进一步下降显存不足时一部分层会被放到内存里计算这属于能跑但体验一般的状态。我的建议是先把 7b 作为主力版本14b 以上留到换显卡或者确认自己确实需要更高质量输出之后再上。3.4 删除模型给 C 盘和其他盘腾空间下载了多个版本但实际只用一个是本地部署最容易犯的错误。70b 一个模型就占 40GB删模型这个操作必须要会# 列出所有本地模型确认名字和占用的空间 ollama list # 删除指定的模型删除后不可恢复 ollama rm deepseek-r1:7bollama rm后面跟的是模型完整名称和标签比如deepseek-r1:7b少写标签可能会提示找不到模型。模型文件是纯权重文件删除后没有后悔药需要重新下载。建议删除前先执行ollama list看清楚确定自己不再用这个版本再动手。3.5 ollama 怎么调用显卡AMD 老卡的真实体验ollama ps是排查模型有没有跑在显卡上的关键命令# 查看当前模型进程在 GPU 还是 CPU 上运行 ollama ps输出里会显示 GPU 或 CPU 的使用情况。如果显示 100% CPU说明模型根本没进显卡。Ollama 在 Windows 上对 NVIDIA 支持最成熟AMD 显卡要看 ROCm 是否覆盖你的型号。我实测 VEGA 56 这种老卡即使驱动正常Ollama 也可能直接退回 CPU 推理ollama ps看不到 GPU 占用。这种情况下要么接受 CPU 龟速要么在聊天场景改用第 4 章的 API 方案让云端 GPU 帮你推理。对大部分人来说用 API 做日常问答、把大模型留给本地无法联网的场景是更务实的路线。4. 用 ChatBox 接入 DeepSeek硅基流动 API 密钥与模型配置4.1 为什么绕开官方 API 选硅基流动本地模型覆盖不了所有场景时云端 API 就是第二梯队。原教程的建议是使用硅基流动核心原因是官方 API 入口在高峰期经常不稳定响应慢甚至连不上而硅基流动的参数和价格与官方一致调用方式又完全兼容 OpenAI 格式给了 ChatBox 这类客户端一个标准化的接入点。硅基流动的操作流程很简单注册账号、生成 API 密钥、在 ChatBox 里配置 Host 和模型名整个链路五分钟能跑通。密钥只显示一次生成后一定要立即复制保存。4.2 ChatBox 下载与配置参数ChatBox 官方页面提供网页版和桌面版功能一致桌面版适合日常挂着用。下载启动后进入左下角设置页核心参数如下配置项填写内容Model ProviderOpenAI APIAPI Key复制的硅基流动密钥API Hosthttps://api.siliconflow.cn/v1Model Namedeepseek-ai/DeepSeek-R1设置里最容易出错的是 API Host 的结尾必须带/v1而且模型选择方式要改成自定义模型。ChatBox 默认有很多内置模型列表但这些列表里的模型版本往往和硅基流动不完全匹配手动输入模型名更稳。{ provider: OpenAI API, apiKey: 这里换成你的密钥, apiHost: https://api.siliconflow.cn/v1, model: deepseek-ai/DeepSeek-R1 }这段 JSON 不是让你去写配置文件而是展示 ChatBox 设置页里各项参数和实际请求的对应关系。其中model字段直接决定了请求发到服务端后走哪个模型写错会出现模型不存在或返回格式错误。4.3 第一次聊天的验证方法配置完成后点击左下角 New Chat随便问一个问题测试。DeepSeek-R1 是推理模型它的回答经常带着「思考」过程这是正常现象不是故障。R1 系列和普通对话模型最大的区别就在这里它会先输出一段内部推理再给出最终结论在 ChatBox 里能看到明显的分阶段输出。4.4 界面汉化ChatBox 默认英文界面在左下角 Settings 里找到 Display第一个语言选项改成中文就能整体汉化。这个细节看起来不起眼但对非英语环境的新手来说汉化后找设置项的效率完全不一样。5. 本地部署 DeepSeek 的避坑与排查实测中常见的五个问题5.1 ollama run 卡在 pulling进度条长期不动现象执行ollama run deepseek-r1:7b后显示 pulling进度停留在 0% 或几十 MB等十几分钟没变化。原因模型权重存储在国外服务器国内网络环境下载速度不稳定是常态不一定是配置问题。解决先确认安装包来源官网下载慢就换 GitHub releases 备份或网盘离线包。模型下载慢则不要反复重试Ollama 支持断点续传先等 10 到 15 分钟观察进度如果完全不动考虑换低峰时段重试。下载过程中 C 盘磁盘空间不足也会造成进度卡死顺手检查一下磁盘剩余空间。5.2 改了 OLLAMA_MODELS模型仍然装到了 C 盘现象按教程设置了OLLAMA_MODELSD:\OllamaModels但执行ollama list后发现新模型还是在 C 盘默认路径。原因环境变量修改后没有重启 Ollama 进程setx只对之后启动的进程生效后台服务还保留着旧路径。解决打开任务管理器在详细信息里找到所有 Ollama 相关进程全部结束然后重新打开命令行执行ollama run。重启后再次用ollama list确认如果模型已在旧路径下载完把它手动移动到新目录再执行ollama list验证识别。注意设置环境变量后重启系统是最保险的做法比手动杀进程更省事。5.3 ChatBox 提示 Invalid API Key 或 401现象密钥填好后发消息立刻返回 401 或提示密钥无效。原因两种可能一是密钥复制时缺字符或带了空格二是 API Host 设置错误比如漏了/v1或写成了https://api.siliconflow.cn。解决回到硅基流动后台重新生成密钥复制时确认头尾没有空格。然后检查 API Host 是否严格为https://api.siliconflow.cn/v1这个路径决定了客户端把请求发到哪个接口版本。还有一点容易忽略ChatBox 里的 Model Name 必须和平台提供的模型 ID 完全一致写DeepSeek-R1和deepseek-ai/DeepSeek-R1是两种结果。5.4 显存足够但推理速度极慢ollama ps 显示 CPU 占用现象显卡显存明明够但对话生成每个字都要等几秒ollama ps显示模型跑在 CPU 上。原因Ollama 在 Windows 上对 AMD 显卡的 ROCm 支持不完整老卡尤其明显它会把模型放在 CPU 上跑。NVIDIA 显卡用户则可能是驱动版本太旧没有正确识别 GPU。解决先执行ollama ps确认当前模型是否在 GPU 上如果显示 CPUNVIDIA 用户升级显卡驱动AMD 用户尝试安装 ROCm 对应版本。老卡折腾一圈仍然调用不了显卡的话不要再恋战直接把日常对话切到第 4 章的 API 方案本地模型留给纯离线场景。5.5 Cherry Studio 问答时查不到知识库内容现象知识库已经创建、文档也上传了但聊天时问相关问题回答和文档内容对不上。原因知识库索引依赖嵌入模型把文本转成向量只添加了对话模型没有添加嵌入模型检索环节出来的结果就是乱找的。解决在 Cherry Studio 的模型管理里同时添加对话模型和嵌入模型嵌入模型推荐BAAI/bge-m3或nomic-embed-text。然后回到知识库设置重新执行索引等文档状态从等待变为已完成再在聊天中挂载该知识库测试。6. Cherry Studio 构建私有知识库把 DeepSeek 变成能查本地资料的智能体6.1 为什么从 ChatBox 换到 Cherry StudioChatBox 适合对话Cherry Studio 适合做知识库。原教程里明确写了 Cherry Studio 的功能和 ChatBox 一致但更强大可以从 ChatBox 无缝迁移过来。它的优势在于同一套 API 密钥可以同时连接云端模型和本地 Ollama 模型知识库管理也内置在界面里不用自己写脚本做向量化。如果你已经按第 4 章配置好硅基流动Cherry Studio 只需要做两件事把 API 密钥填进去再把对话模型和嵌入模型各加一个。原来在 ChatBox 上的使用习惯基本不用改。6.2 安装与 API 配置下载地址为 Cherry Studio 官网选择对应系统的安装包Windows 装完直接打开。进入设置界面选择硅基流动作为模型服务商填入之前复制的 API 密钥。在模型管理中添加两个模型模型类型推荐模型作用对话模型deepseek-ai/DeepSeek-R1生成回答嵌入模型BAAI/bge-m3文档向量化知识库检索对话模型决定回答质量嵌入模型决定能不能找到正确的资料。很多人知识库「答非所问」的根源就是只加了对话模型没加嵌入模型。6.3 添加知识库并建立索引在 Cherry Studio 的知识库页面点击创建命名后导入本地文档支持 txt、pdf、md 等常见格式。文档上传后系统会调用嵌入模型做切片和向量化每一步都会显示状态。知识点在这里文档切片的粒度影响检索质量。切得太粗一个块里夹杂多个主题检索到它时模型容易答偏切得太细单个块信息量不足。Cherry Studio 默认切片设置对绝大多数文档是合理的先用默认值等出现检索不准再调整切片大小。6.4 聊天中挂载知识库验证知识库索引完成后新建对话在对话框上选择刚才创建的知识库然后提一个能从文档中找到明确答案的问题比如文档里某个参数的具体值。如果回答内容和文档一致说明整条链路已经通了。要注意知识库使用的 token 消耗比普通对话高因为每次提问都要先用嵌入模型把问题向量化再从库里检索相关片段。频繁问同一个话题时 token 消耗是叠加的建议只在需要查文档时才挂载知识库。6.5 验证习惯与本地知识库的下一步从那台 VEGA 56 上翻车之后我形成了两个固定习惯。第一任何本地部署都先从最小模型跑通流程再上大模型绝不在第一步就赌 70b。第二切到 Cherry Studio 做知识库时先建一个只有两三页文档的测试库把「上传 → 索引 → 检索 → 回答」全链路验证完再正式导入生产资料这样排查问题范围小得多。原教程里「基于 Ollama 实现本地知识库」还标注为待完成这也正是我下一步要试的方向把对话模型和嵌入模型都改成本地 Ollama 服务让 Cherry Studio 走本地推理链路完全脱离云端 API。到时候需要额外拉一个嵌入模型比如nomic-embed-text到本地再在 Cherry Studio 里把模型服务商从硅基流动切换到 Ollama知识库的索引和查询就都不走外网了。折腾这套东西最大的教训是先验证再优化先把流程跑通再谈性能和效果每一步都控制在可回退的范围内希望帮到你。本文还有配套的精品资源点击获取