DeepSpeed Windows 安装指南:从环境自测到跑通三个训练示例 DeepSpeed Windows 安装指南从环境自测到跑通三个训练示例【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed这篇文章帮你在 Windows 11 上完成 DeepSpeed 的安装、验证并跑通三个官方示例。DeepSpeed 是微软开源的深度学习优化库提供 ZeRO、3D 并行、MoE 等优化用于 Phi-3、Megatron-Turing-530B 等模型的分布式训练与推理Windows 支持自 0.14.5 版本起提供覆盖单卡训练、微调和推理体验与 Linux 一致。动手前先核对你的环境组件版本要求必需/可选Windows11 Version 23H2 及以上必需带 CUDA 的 NVIDIA 显卡 驱动官方在 4GB 显存的 RTX A2000 上完成验证必需Python3.x必需PyTorch2.3.0 带 CUDA 版本官方测试配置必需Visual C 构建工具VS2022 C x64/x86 build tools可选仅源码构建路线需要HuggingFace Transformers4.41.2官方测试配置可选微调与推理示例需要DeepSpeedExamples 仓库最新版可选运行三个示例前需克隆三条安装路线选对一条DeepSpeed Windows 安装安装方式适用场景一行命令pip 安装 ⭐大多数用户快速上手pip install deepspeed源码构建需要最新代码或自行修改克隆仓库后运行build_win.bat预编译 wheel 分发多台同配置机器DS_BUILD_OPS1 python -m build --wheel --no-isolation推荐 pip 路线Windows 版本已预编译全部算子无需安装 CUDA SDK 或 C 编译器一条命令即可pip install deepspeed # 安装最新版Windows 版算子已预编译源码构建路线适合需要定制的场景克隆 仓库 后运行 build_win.batwheel 会生成在dist目录前置条件见 README 的 Windows 章节。预编译分发路线说明见 进阶安装文档。一条命令自测安装安装完成后运行环境自测ds_report # 或 python -m deepspeed.env_report预期输出关键几行| | DeepSpeed Version: 0.14.5 | nvcc (nvCC): Cuda compilation tools, release 12.x | torch cuda: 12.x输出即安装报告重点看 DeepSpeed 版本是否为你刚安装的 0.14.5、CUDA 相关行是否为 OK任一行报错先看下一节的排错表。跑通三个真实示例以下示例脚本来自 DeepSpeedExamples 仓库运行前先克隆该仓库并进入对应目录。示例一CIFAR-10 小模型训练最简单的单卡训练闭环验证 DeepSpeed 训练链路deepspeed cifar10_deepspeed.py --deepspeed # 脚本位于 training/cifar预期结果终端滚动输出每个 step 的 loss数值逐步下降。示例二BERT 预训练语言模型预训练脚本位于training/HelloDeepSpeed目录deepspeed train_bert_ds.py --checkpoint_dir experiment_deepspeed # 检查点输出到该目录预期结果训练正常启动并持续输出 loss运行结束后experiment_deepspeed目录中出现检查点文件。示例三OPT-125M 模型微调LoRA CPU offload对 facebook/opt-125m 做监督微调同时启用 LoRA 与 ZeRO-2 的 CPU offload4GB 显存即可运行deepspeed training\step1_supervised_finetuning\main.py --model_name_or_path facebook/opt-125m --gradient_accumulation_steps 8 --lora_dim 128 --only_optimize_lora --print_loss --zero_stage 2 --deepspeed --dtype bf16 --offload --output_dir output预期结果终端逐条打印 lossoutput目录生成微调后的模型权重。出问题先看这里报错现象最常见原因解决办法源码构建时报 C 编译错误未装 C 构建工具安装 VS2022 的 C 桌面开发 工作负载VS2019 亦可以管理员身份运行 Visual Studio 2022 开发者命令提示符Installed CUDA version ... does not match the version torch was compiled with系统 CUDA 与 PyTorch 编译所用 CUDA 主版本不一致运行nvcc --version和python -c import torch; print(torch.version.cuda)核对重装匹配的 PyTorch或按 advanced-install.md 的 CUDA version mismatch 小节处理CUDA error: no kernel image is available for execution on the device扩展未针对你的显卡架构编译构建时设置TORCH_CUDA_ARCH_LIST指定架构方法见 advanced-install.md或直接用 pip 预编译版微调/推理示例报显存不足4GB 显存装不下模型与生成工作集保持示例中--offload/--cpu-offload参数将权重卸载到 CPU 内存用到 async ioAIO或 GDS 功能失败两项功能不支持 Windows官方说明见 README Windows 章节Windows 上请避开这两项功能资源与路线图Windows 支持官方博客英文Windows 支持官方博客中文进阶安装指南上手教程仓库 README含 Windows 安装步骤当前 Windows 版尚不支持多 GPU 运行与权重量化async io 和 GDS 也未适配官方路线图的下一步就是多 GPU 支持、权重量化和性能研究。卡住时先看 Windows 博客文档 和 advanced-install.md。【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考