2026/08/16 AI学习笔记 一 . Ollama学习笔记1. ollama概述Ollama 可以理解成“本地版的 OpenAI API”可以直接调用不需要通过互联网。没有部署的:你的电脑│▼Spring AI│▼互联网│▼DeepSeek / OpenAI / 豆包│▼返回结果部署ollama的:你的电脑│▼Spring AI│▼Ollama│▼Qwen3 8B│▼返回结果2. ollama的优势1. 模型切换方便想测试Qwen3DeepSeekLlamaGemmaMistral直接下面命令下载:ollama pull qwen3:8bollama pull gemma3:4bollama list进行查看:想使用哪个可以直接运行ollama run qwen3:8bollama run gemma3:4bollama run qwen3:8b --thinkfalse(关闭思考模式)2. ollama不是运行器AI应用│▼Spring AI│▼┌───────────┐│ Ollama │ ← 运行器/API└───── ┬─────┘│┌─────── ┴────────┐▼ ▼Qwen3 8B Embedding模型│▼GPU / CPUollama不是大模型它是一个负责运行大模型的软件。3. 后续学习路线spring ai和ollama本地大模型进行交互3. CPUGPUOllama大模型之间的关联1. 本机电脑说明例如下面电脑的配置:CPUi7-8750HRAM16GBGPUGTX 1060 6GB运行:Ollama↓Qwen3 8B实际上是CPU RAM GPU 显存一起协作只是各自负责的工作不一样。RAM 是“仓库”显存是“GPU旁边的小仓库”CPU/GPU 是“工人”。2. Ollama 为什么会消耗 GPU因为Ollama是模型运行器真正工作的是CPU/GPU。真正消耗GPU的是:Qwen3 模型的神经网络计算。Ollama 只是负责把这些计算任务安排给 CPU/GPU。3. 为什么大模型特别喜欢 GPU因为大模型最核心的工作本质上是大量矩阵运算。比如神经网络里面会出现大量矩阵 × 矩阵矩阵 × 向量假设有A 1000 × 1000B 1000 × 1000计算A × B需要做非常多的乘法和加法。cpu也可以算。但是 CPU 更擅长少量、复杂、串行而 GPU 非常擅长大量、简单、并行所以CPU一个工人一个一个处理GPU几千个小工人同时处理这就是为什么大模型推理非常适合 GPU。4. RAM 和显存有什么区别RAM容量比较大CPU使用。VRAMGPU自己的高速内存GPU使用。5. ollama启动时候模型是如何进行加载的启动:ollama run qwen3:8b发生:流程第一步: 模型放在E盘第二步: Ollama运行模型E盘↓RAM把模型加载到内存。第二步: 如果 GPU 可用RAM↓VRAM把一部分模型放到显存。第四步GPU开始计算GPU↓矩阵运算↓生成token6. CPU GPU 混合运行一部分计算放 GPU。另一部分留给 CPU。电脑运行时候大模型的真实情况:6. CPU消耗啥① 模型加载硬盘 → RAM② CPU上的模型计算如果模型有一部分没有放到 GPUCPU↓计算③ 数据处理Prompt↓Tokenizer↓Token这些也可能消耗 CPU。7. RAM 到底消耗什么模型权重CPU计算部分GPU传输缓存KV CacheOllamaWindowsIDEASpring Boot8. GPU 到底消耗什么GPU主要负责大规模并行计算。比如Token↓Embedding↓Transformer↓Attention↓Linear↓Transformer↓...↓下一个Token其中大量矩阵计算可以交给 GPU。9. GPU利用率和显存占用不是一回事GPU利用率: GPU计算有多忙。显存占用: GPU里面放了多少数据.例如 5.5GB / 6GB说明GPU显存快装满了。10. 为什么 GPU 会比 CPU 快100万对的相似的小计算cpu一个一个串行处理gpu大量的的并行处理。