如何快速上手Nemotron:从零搭建大模型训练环境完整教程 如何快速上手Nemotron从零搭建大模型训练环境完整教程【免费下载链接】NemotronDeveloper Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models项目地址: https://gitcode.com/gh_mirrors/ne/NemotronNemotron 是 NVIDIA 开源的大模型开发者资源中心提供训练配方、使用 Cookbook、开放数据集与端到端参考示例。本教程面向新手带你从零搭建一套可用的 Nemotron 大模型训练环境5 分钟完成安装跑通第一条训练命令并理解如何编排「预训练 → 监督微调SFT→ 强化学习RL」的完整训练流水线。一、认识 Nemotron四大资源板块Nemotron 仓库不是一个单一的训练框架而是一个「一站式资源中心」。在动手之前先了解它的四大板块方便你按目标找到对应文档板块用途路径Nemotron Steps可复用的训练「积木」数据准备、训练、评测通过nemotron stepsCLI 调用src/nemotron/steps/Training Recipes完整可复现的训练流水线原始数据 → 成品模型src/nemotron/recipes/Usage Cookbooks模型部署与推理使用指南Jupyter Notebookusage-cookbook/Use Case ExamplesRAG、Agent、工具调用等端到端应用示例use-case-examples/模型家族按规模分为四层Nano边缘/PC 部署、Lightning高吞吐任务执行、Super单 GPU 最高吞吐、Ultra多 GPU 数据中心级。各模型的训练指南见 docs/nemotron/nano3/README.md 等目录。二、环境准备3 步安装 Nemotron 训练环境搭建大模型训练环境只需要两个前置条件Python 3.10项目要求3.10,3.14见 pyproject.tomluv包管理器已加入 PATH然后执行以下 3 步即可# 1. 克隆 Nemotron 仓库并进入根目录 git clone https://gitcode.com/gh_mirrors/ne/Nemotron cd Nemotron # 2. 同步所有公共依赖 uv sync # 3. 验证 CLI 可用无需 GPU 和集群 uv run nemotron steps --help如果第 3 步能列出list、show、run等子命令说明你的大模型训练环境已经就绪。三、理解核心概念Step、配置与环境档案跑通命令之前先花 2 分钟理解 4 个核心概念完整定义见 docs/steps/basics.md概念一句话解释Step步骤具名可复用的工作单元如sft/automodel、rl/nemo_rl/dpo声明它「消费什么、产出什么」Configuration配置一组具名参数tiny用于低成本验证流程default用于生产级训练Environment Profile环境档案描述执行目标容器镜像、节点数、GPU 型号、挂载点存放在env.tomlArtifact产物步骤间传递的类型化数据如training_jsonl、checkpoint_hf、eval_results步骤之间靠Artifact 类型匹配自动衔接上一步产出的数据正是下一步的输入。数据从粗到细经过过滤、清洗、分片的「漏斗式」处理流程是 Nemotron 数据准备的核心理念四、5 分钟跑通第一条命令探索 Step 目录以下命令全部只读取元数据不需要 GPU 和集群适合在任何开发机上练习# 列出所有可用 Step表格含类别、输入/输出产物类型 uv run nemotron steps list # 只看监督微调SFT相关步骤类别与 src/nemotron/steps/ 下的目录一一对应 uv run nemotron steps list --category sft # 查看单个 Step 的完整清单输入、输出、参数默认值、运行规格 uv run nemotron steps show sft/automodel想搞清楚「哪些步骤能串成流水线」用--produces/--consumes双向查询# 所有能产出训练 JSONL 数据的步骤如合成数据生成 uv run nemotron steps list --produces training_jsonl # 所有能消费训练 JSONL 数据的步骤如 SFT、RL 训练 uv run nemotron steps list --consumes training_jsonl例如sdg/data_designer产出training_jsonlsft/automodel消费training_jsonl—— 两个步骤即可直接串联无需中间转换。五、配置执行环境用 env.toml 描述你的训练集群真实训练需要 GPU 集群。Nemotron 通过环境档案Profile管理执行目标推荐用内置生成器一步产出档案文件而不是手写# 从模板生成 Lepton / Slurm / DGX Cloud 档案写入 env.lepton.toml 等 uv run nemotron steps run env/env_toml -c lepton # 让 CLI 指向生成的档案文件 export NEMOTRON_ENV_FILEenv.lepton.toml生成后打开 TOML 文件替换节点组、资源形状、工作路径等占位符敏感信息用${oc.env:VAR_NAME}占位符从环境变量注入避免密钥落盘。完整配置说明见 docs/nemo_runspec/nemo-run.md。⚠️硬件门槛数据准备与模型训练类步骤不支持本地工作站需要至少2 节点 × 8 张 A100 80GB或更好GPU当前支持 Slurm、NVIDIA DGX Cloud Lepton、NVIDIA Run:ai 三种环境详见 docs/train-models/index.md。六、提交第一个训练任务tiny 配置验证配置好档案后先用tiny配置做一次端到端验证——它使用小数据集和少量迭代只验证「流程通了」不消耗有意义的算力# 先干跑编译并打印执行计划不真正提交 uv run nemotron steps run sft/automodel -c tiny -r lepton_sft_automodel --dry-run # 验证无误后正式提交-r 附带日志流日志实时回传终端 uv run nemotron steps run sft/automodel -c tiny -r lepton_sft_automodel提交成功即证明CLI 正确加载了档案文件、匹配到命名 Profile、资源形状被集群接受。长时训练可将-r换成-b以「提交即返回」方式后台运行。七、从数据到模型端到端训练配方当你完成单步验证就可以进入完整的训练配方了。仓库为每个旗舰模型都提供了可复现的三段式流水线原始数据 → 基座模型 → 指令模型 → 对齐模型模型规模训练阶段训练指南Nemotron 3 Nano31.6B 总参 / 3.6B 激活 MoEPretrain → SFT → RLdocs/nemotron/nano3/README.mdNemotron 3 Super120.6B 总参 / 12.7B 激活Pretrain → SFT → RLdocs/nemotron/super3/README.mdNemotron 3 Ultra550B 总参 / 55B 激活1M 上下文Pretrain → SFT → RLVR → MOPDdocs/nemotron/ultra3/README.mdNemotron 3 Nano Omni30B-A3B 多模态SFT → RL → Evaldocs/nemotron/omni3/README.md以 Nano 配方为例完整流水线只有 6 条命令每个阶段先data prep再训练配方文档见 src/nemotron/recipes/nano3/README.md# Stage 0数据准备 预训练 uv run nemotron nano3 data prep pretrain --run YOUR-CLUSTER uv run nemotron nano3 pretrain --run YOUR-CLUSTER # Stage 1数据准备 监督微调SFT uv run nemotron nano3 data prep sft --run YOUR-CLUSTER uv run nemotron nano3 sft --run YOUR-CLUSTER # Stage 2数据准备 强化学习RL uv run nemotron nano3 data prep rl --run YOUR-CLUSTER uv run nemotron nano3 rl --run YOUR-CLUSTER各阶段的数据混合比例是训练质量的关键。以 Super 配方的 SFT 数据为例Agent 类数据占 36%、Reasoning 占 31%、Chat 占 23%RL 阶段则采用 NeMo-RL 的 Actor 架构Policy 模型策略、Policy Generation生成引擎vLLM/TRT-LLM、Reward/Critic 三类 Actor 各自持有独立的 Ray Worker 组调度到虚拟集群的 GPU 上协同工作所有阶段通过 WB Artifacts 自动串联产物血缘从原始数据到最终模型全程可追溯需要部署推理时再用usage-cookbook/中对应模型的 Notebook 即可。八、常见问题速查问题解决办法nemotron steps --help报错找不到命令确认在仓库根目录执行且先运行了uv sync提交任务报 Profile 不匹配检查-r参数名是否与env.toml或NEMOTRON_ENV_FILE指向的文件中的表名完全一致想在本地跑训练训练类步骤不支持本地工作站请准备 Slurm / Lepton / Run:ai 集群想改某个超参无需改文件直接在命令行追加keyvalue如train.train_iters5000覆盖想只跑单个环节用nemotron steps list --produces/--consumes查产物类型自由组合 Step 成自定义流水线总结你的 Nemotron 学习路线环境与概念uv sync装环境 → 读懂 docs/steps/basics.md 的四大概念CLI 探索按 docs/steps/getting-started.md 练习list/show/run端到端验证用tiny配置 --dry-run跑通第一个训练任务真实训练参考 docs/train-models/getting-started.md 配置集群档案并提交任务深入配方研读 src/nemotron/recipes/ 下各模型配方复现完整训练流水线搭好训练环境只是起点——Nemotron 的价值在于让你能像搭积木一样把数据准备、训练、评测的每一步自由组合构建属于自己的大模型训练流水线。【免费下载链接】NemotronDeveloper Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models项目地址: https://gitcode.com/gh_mirrors/ne/Nemotron创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考