NVIDIA Model Optimizer Linux 安装指南:系统要求、环境搭建与依赖配置全解析 【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址https://gitcode.com/GitHub_Trending/te/Model-Optimizer点击查看免费下载本篇指南完整讲解 NVIDIA Model Optimizernvidia-modelopt在 Linux 系统上的安装流程覆盖系统要求、Docker 与本地PIP/Conda两种环境搭建路径、可选依赖模块的正确选取以及安装后的核验方法。读者将能根据自身部署目标TensorRT-LLM / ONNX / Hugging Face准确选择安装方式与 optional dependencies并完成首次 CUDA 扩展编译与预编译验证。一、系统要求先确认硬件与软件基线根据官方安装文档最新版nvidia-modelopt在 Linux 上的系统要求如下项目要求操作系统OSLinux架构Architecturex86_64、aarch64 (SBSA)Python 3.10, 3.15CUDA12.x、13.xPyTorch 2.8TensorRT-LLM可选 1.0ONNX Runtime可选1.24TensorRT可选 10.0几点说明Python 版本约束与项目元数据一致pyproject.toml中声明requires-python 3.10,3.15与上表完全对应这意味着 Python 3.103.14 均可用3.15 及以上暂不支持。PyTorch 是硬性依赖核心依赖列表固定了torch2.8安装时会随主包一并解析。可选项以部署目标为导向TensorRT-LLM、ONNX Runtime、TensorRT 均标注为可选说明仅当你要将量化产物导出到对应推理框架时才需要安装这直接影响下文可选依赖的选择策略。二、环境搭建Docker 与本地环境的双路径选择官方文档提供了两条并行的环境搭建路径可根据使用场景二选一。2.1 Docker 镜像推荐含完整部署依赖如果要在完整依赖例如 TensorRT / TensorRT-LLM 部署下使用 Model Optimizer推荐直接使用预装了 Model Optimizer 的 TensorRT-LLM Docker 镜像nvcr.io/nvidia/tensorrt-llm/release:version使用 Docker 路径时的三个要点镜像内已预装 Model Optimizer但建议用 pip 按下一节说明升级到最新版本避免使用镜像内置的旧版本。按需设置 TensorRT 相关环境变量官方给出的示例为export PIP_CONSTRAINT export LD_LIBRARY_PATH${LD_LIBRARY_PATH}:/usr/include:/usr/lib/x86_64-linux-gnu补充示例依赖具体示例如 examples/hf_ptq可能还需要安装各自requirements.txt中的额外依赖。其他可选的 NVIDIA 官方镜像PyTorch 场景使用 NGC PyTorch 容器nvcr.io/nvidia/pytorch:version-py3Model Optimizer 已预装适合以 PyTorch 为主的量化工作流。Megatron-Bridge / Megatron-LM 框架使用 NeMo 容器nvcr.io/nvidia/nemo:versionModel Optimizer 已预装适合剪枝、蒸馏等训练型优化技术。ONNX / TensorRT 场景使用 TensorRT 容器nvcr.io/nvidia/tensorrt:version-py3官方明确说明其性能优于 PyTorch 容器适合 examples/onnx_ptq 这类工作流。注意拉取和使用容器镜像前请先阅读并遵守各镜像自身的许可条款。2.2 本地环境PIP / Conda不使用 Docker 时推荐先在本地建立独立虚拟环境第一步创建并激活 conda 环境conda create -n modelopt python3.12 pip conda activate modelopt官方文档以 Python 3.12 为例它在 3.103.14 的支持范围内且pyproject.toml的文档构建与测试体系也以 Python 3.12 为主线是一个稳妥的选择。第二步可选安装指定版本的 PyTorch默认情况下会安装 pip 上最新的 PyTorch。如需为特定 CUDA 版本安装特定 PyTorch请先按照 PyTorch 官方本地安装指引安装对应版本再继续安装 Model Optimizer。第三步可选安装其他 NVIDIA 依赖库如果想与 TensorRT、TensorRT-LLM、Megatron-Bridge、Megatron-LM、Triton 等其他 NVIDIA 库搭配使用请先确认这些库在本地环境中的安装难度。若遇到依赖冲突问题官方建议改用 Docker 镜像以获得无缝体验。同时也可以采用混合工作流在本地仅用 Model Optimizer 完成 HuggingFace 模型量化再进入 Docker 镜像完成部署环节。三、安装 Model Optimizer主包与可选依赖的精确组合Model Optimizer 在安装过程中会下载并安装额外的第三方开源软件使用前请先审阅这些开源项目的许可条款。3.1 一键全量安装如果使用官方 Docker 镜像已含 ModelOpt 及全部可选依赖可跳过安装步骤若使用其他建议的镜像ModelOpt 可能只预装了部分可选依赖请按需用 pip 升级。常规安装命令为pip install -U nvidia-modelopt[all]其中[all]在 pyproject.toml 中定义为nvidia-modelopt[onnx,hf,puzzletron]即一次安装 ONNX、Hugging Face、Puzzletron 三组可选依赖。3.2 按模块精确选择 partial dependencies如果不加任何可选依赖安装的nvidia-modelopt仅包含modelopt.torch包所需的基础依赖其他模块必须搭配对应的可选依赖或[all]才能正常工作。官方文档给出的模块与可选依赖对应关系如下模块可选依赖modelopt.onnx[onnx]modelopt.torch._deploy[onnx]可见 ONNX 相关能力modelopt/onnx 模块及其 ONNX 导出/量化管线与部署工具链modelopt.torch._deploymodelopt/torch/_deploy都依赖[onnx]组。此外还支持为第三方包安装依赖第三方包可选依赖Hugging Facetransformers、diffusers等[hf][hf]组在pyproject.toml中涵盖了accelerate、datasets、diffusers、transformers、peft、deepspeed等库是运行 examples/hf_ptq、examples/llm_qat 等 Hugging Face 工作流的前提。典型安装组合示例# 仅量化 ONNX 模型 pip install -U nvidia-modelopt[onnx] # 量化 Hugging Face 模型 pip install -U nvidia-modelopt[hf] # 全量安装ONNX HF Puzzletron pip install -U nvidia-modelopt[all]3.3 CUDA 专属依赖cupy 的版本匹配默认情况下[onnx]依赖会安装cupy-cuda12x以支撑 INT4 ONNX 量化。若你的环境是 CUDA 13则需要在安装nvidia-modelopt[onnx]之后执行pip uninstall -y cupy-cuda12x pip install cupy-cuda13x这一点与系统要求表中 CUDA 12.x / 13.x 的支持范围相呼应——cupy 的 CUDA 绑定必须与本地 CUDA 版本一致否则 INT4 ONNX 量化链路可能无法正确加载内核。四、加速量化Triton Kernels 的启用条件ModelOpt 内置了基于 Triton 语言实现的优化量化内核可将量化运算速度相比默认实现提升约 40%对 AWQINT4 权重仅量化 和量化感知训练QAT工作流尤其有价值。从源码看内核的可用性由 modelopt/torch/kernels/quantization/gemm/init.py 统一探测当torch.cuda.is_available()且能成功导入triton时会自动加载 FP4、FP8 等 Triton 内核其中fp4_kernel_hopper额外要求 GPU 计算能力 8.9因为它使用了tl.float8e4nv。官方文档给出的启用条件为CUDA 设备计算能力 8.9例如 RTX 40 系列、RTX 6000、NVIDIA L40 及更新型号安装 Tritonpip install triton。无需额外配置——只要硬件与量化格式满足条件优化内核会被自动选用。当前 Triton 内核支持 NVFP4 量化格式后续版本会扩展更多格式。需要留意的是Triton 内核主要加速量化模拟/前向过程与上文的本地依赖安装是两个独立的维度。五、检查安装预编译 CUDA 扩展首次使用 ModelOpt 的 PyTorch 量化 API 时它会利用本机已安装的 torch 与 CUDA 编译快速量化内核编译可能需要几分钟但后续量化调用会显著加快。编译过程由 modelopt/torch/quantization/extensions.py 驱动其底层load_cpp_extension实现见 modelopt/torch/utils/cpp_extension.py会根据torch.version.cuda与 CUDA 版本约束做匹配检查并依据设备计算能力自动设置TORCH_CUDA_ARCH_LIST再调用torch.utils.cpp_extension.load()完成编译。为了触发编译、验证是否成功或在构建 Docker 镜像时预先完成编译请运行python -c import modelopt.torch.quantization.extensions as ext; ext.precompile()precompile()会依次编译并打印四组扩展modelopt_cuda_exttensor_quant 通用内核、modelopt_cuda_ext_fp8FP8 量化内核、modelopt_cuda_ext_mxMX 格式内核以及modelopt_cuda_ext_ggmlGGML 兼容 IQ 打包内核。所有扩展均采用懒加载缓存首次访问后缓存在函数属性上因此预编译一次后后续量化调用可直接命中已编译产物。六、安装后的下一步安装完成并核验通过后可基于本仓库继续深入量化指南docs/source/guides/1_quantization.rst 与 docs/source/guides/_pytorch_quantization.rst 介绍 PTQ 的具体 API 用法方法选型docs/source/guides/_choosing_quant_methods.rst 提供 FP8、INT8 SmoothQuant、INT4 AWQ 等方法的精度/性能取舍对照可帮助判断哪种量化格式需要 Triton 加速实战示例examples/hf_ptq/README.mdHugging Face PTQ、examples/onnx_ptq/README.mdONNX 量化均附带各自的requirements.txt安装后即可按示例脚本复现完整流程。本文结论在 Linux 上使用 Model Optimizer 的完整路径可概括为——确认系统要求Linux x86_64/aarch64 Python 3.10–3.14 CUDA 12/13→ 选择 Docker 或 Conda 本地环境 → 按目标模块选择[onnx]/[hf]/[all]可选依赖CUDA 13 用户需替换 cupy→ 如需 40% 量化加速则确保计算能力 8.9 并安装 Triton → 最后通过ext.precompile()验证内核编译即可进入量化实战。赞分享【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址https://gitcode.com/GitHub_Trending/te/Model-Optimizer点击查看免费下载相关推荐NVIDIA Model Optimizer 安装指南Linux 与 Windows 全平台环境搭建与验证实战NVIDIA Model Optimizer 安装指南Linux 与 Windows 全平台环境搭建与验证实战 导读 本文是 Model OptimizerAntiSplit-M完整教程5步学会将分拆APK转为标准安装包AntiSplit M完整教程5步学会将分拆APK转为标准安装包 你是否曾经下载了分拆APK文件APKS/XAPK/APKM格式却无法直接安装 今天移动开发开发工具Flask 安装与环境配置指南从 Python 版本要求到依赖体系全解析Flask 安装与环境配置指南从 Python 版本要求到依赖体系全解析 Flask 的安装过程本身很轻量但其背后涉及明确的 Python 版本约束、一组精后端Web框架创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考