
train-llm-from-scratch 文档图例颜色体系10 色可视化规范一次读懂 LLM 训练流程图【免费下载链接】train-llm-from-scratchA straightforward method for training your LLM, from downloading data to generating text.项目地址: https://gitcode.com/GitHub_Trending/tr/train-llm-from-scratchtrain-llm-from-scratch 是一个从零训练 LLM 的完整流水线项目覆盖数据下载、预训练、SFT、奖励模型、DPO/PPO/GRPO 对齐到评估推理的全流程。为了帮助新手快速看懂十几张架构与训练流程图项目为全部文档图例制定了一套统一的手稿风格颜色体系——10 种颜色对应 10 类角色看到颜色就知道节点含义。本文将完整拆解这套可视化规范。上图为项目总览流水线绿色节点是原始语料黄色六边形是训练阶段Pretrain → SFT橙色是 RL 对齐RM → PPO、DPO、GRPO紫色是 GSM8K 评估出口。下面逐色拆解。10 种颜色角色定义一张表看懂图例规范项目把所有图例的配色集中定义在 images/make_diagrams.py 的PALETTE常量中共 10 个classDef角色色样角色填充色描边色表示含义data#cdeccd#2e7d32原始数据 / 语料The Pile、Alpaca、GSM8Kstore#cfeee9#1f9e8f存储产物HDF5、JSONL 等中间文件proc#cfe3fb#1565c0预处理步骤分词、模板渲染、GAE 计算等model#ffe8a3#d48806模型与训练循环前向、优化器步进rl#ffd9b3#e67e22强化学习 / 奖励信号相关组件loss#ffd4d4#c0392b损失函数 / 训练目标⬜ckpt#ececec#666666检查点与冻结的参考模型eval#e7d6fb#8e44ad评估 / 验收环节out#e7d6fb#7b3fbf中间结果输出如 logits、head 输出⚪op#ffffff#888888纯运算符残差相加等官方图例速记见 docs/diagrams/README.md data / corpus · preprocessing · 青色 storage · model / training loop · RL / reward · loss / objective · evaluation · ⬜ checkpoint文档目录下的图源 docs/diagrams/src/ 使用同一套色相的更浅变体如 data 用#d6ffd9、proc 用#d6e8ff两套调色板角色语义完全一致新手只需记一套含义即可。数据管道图解法绿→蓝→青色的三段式配色数据是 LLM 训练的起点。下图展示四条数据管道颜色规律非常统一绿色原始语料 →蓝色预处理动作 →青色落盘产物。Pretraining 分支绿色 The Pile 语料经蓝色 tiktoken 分词落成青色pile_train.h5由 scripts/pretrain_base.py 消费SFT 分支Alpaca / Dolly / GSM8K 经蓝色 chat 模板渲染与 prompt 掩码后打包为sft_packed.h5偏好 / RL 分支橙色train_reward.py · train_dpo.py · train_ppo.py · train_grpo.py节点提示——偏好与 RL 数据直接喂给强化学习阶段。对应的分词与数据集实现位于 data_loader/data_loader.py预处理逻辑与图中蓝色节点一一对应。模型结构图解法黄色训练循环与蓝色计算步骤模型类图例中黄色model表示可训练主体蓝色proc表示单次前向中的计算步骤紫色out标记结果输出。以多头注意力为例同一输入 x 并行进入多个 head蓝色拼接橙色 rl 类节点因涉及跨头加权后再经输出投影。注意图中每个模块的颜色都能直接对上源码多头实现见 src/models/attention.py整体 Transformer 与损失计算见 src/models/transformer.py。RL 与损失图解法橙色、红色、灰色的分工进入对齐阶段后三色分工让流程一目了然橙色rl奖励与 RL 机制如评分器、KL 惩罚、GAE 优势计算红色loss最终训练目标如 DPO loss、Bradley-Terry loss灰色ckpt检查点或冻结的参考模型frozen reference。DPO 图中策略黄色可训练与参考模型灰色冻结 SFT 副本分别计算序列对数概率汇入红色 DPO lossPPO 图中橙色的 scoring、KL 惩罚、GAE 串联起整条优势估计链。评估收尾则由紫色节点表达如 GSM8K 准确率统计如何修改配色并重新渲染图例整套图例采用 Mermaid 的手绘风格look: handDrawn Comic Sans 字体主题参数集中在 images/mmdc.json线色#3b3b3b、主色即模型黄#ffe8a3。修改配色只需两步编辑图源README 系列图由 images/make_diagrams.py 统一生成.mmd源文件并追加公共PALETTE文档图直接编辑 docs/diagrams/src/ 下对应.mmd总览图为 docs/diagrams/src/00_overview.mmd重新渲染运行 scripts/render_diagrams.sh脚本用 mermaid-cli 将所有.mmd渲染为 2x PNG 嵌入文档保证 GitHub、VS Code 预览下手绘效果一致。小结记忆点内容绿色数据从哪来原始语料蓝 / 青怎么加工预处理与存成什么HDF5/JSONL黄色谁在训练模型与训练循环橙 / 红RL 机制与损失目标灰 / 紫 / 白检查点、评估输出、纯运算符掌握这套 10 色规范后无需逐字阅读节点文本扫一眼颜色即可定位 train-llm-from-scratch 任意流程图中的数据、模型、RL 与评估环节。更多阶段详解可阅读 POST_TRAINING.md 与 docs/ 下的分篇教程。【免费下载链接】train-llm-from-scratchA straightforward method for training your LLM, from downloading data to generating text.项目地址: https://gitcode.com/GitHub_Trending/tr/train-llm-from-scratch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考