TensorRT-LLM跑通Qwen3:5分钟部署指南 TensorRT-LLM跑通Qwen35分钟部署指南【免费下载链接】TensorRT-LLMTensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C runtimes that orchestrate the inference execution in a performant way.项目地址: https://gitcode.com/GitHub_Trending/te/TensorRT-LLM你刚把 Qwen3-30B-A3B 权重拉下来第一条请求 3 秒才见第一个 token这是你 GPU 的极限吗TensorRT-LLM 是 NVIDIA 开源的大模型推理框架Qwen3 稠密0.6B–32B与 MoE30B-A3B/235B-A22B系列均已在主仓库官方支持。用官方调优配置3 步就能起一个 OpenAI 兼容服务单流推理再开 MTP3 投机解码输出速度从 133.5 提到383.1 tokens/s接近2.9 倍。它解决了什么问题PyTorch 默认部署把 MoE 的算力红利30B-A3B 每 token 只激活 3B 参数浪费在内核启动和显存拷贝上。TensorRT-LLM 把融合 MoE 内核、CUDA Graph、分页 KV 缓存打进同一套推理栈服务层直接暴露 OpenAI 接口你不用自己拼调度对比项PyTorch 默认部署TensorRT-LLMMoE 专家并行需手动实现内置一行配置动态批处理分页 KV 缓存自行实现内置自动生效MTP3 投机解码不支持单流输出提速2.9 倍实测OpenAI 兼容 API自行编写一行trtllm-serve三步跑起来第 1 步构建环境。要求 Linux、CUDA 驱动 575 以上make 两条命令完成镜像构建和容器启动git clone https://gitcode.com/GitHub_Trending/te/TensorRT-LLM make -C docker release_build IMAGE_TAGqwen3-local # 构建镜像 make -C docker release_run IMAGE_NAMEtensorrt_llm IMAGE_TAGqwen3-local LOCAL_USER1第 2 步启动服务。直接复用官方调优的qwen3.yaml批上限 161、CUDA Graph 覆盖 1–384不用手动调参EXTRA_LLM_API_FILE/app/tensorrt_llm/examples/configs/curated/qwen3.yaml # 官方调优配置 trtllm-serve Qwen/Qwen3-30B-A3B --host 0.0.0.0 --port 8000 --config ${EXTRA_LLM_API_FILE}第 3 步验证服务。健康检查返回 200 即可发聊天请求首条请求含初始化与编译先预热再压测。单卡用户把模型换成nvidia/Qwen3-8B-FP8量化权重依然一行命令拉起。curl -s -o /dev/null -w Status: %{http_code}\n http://localhost:8000/healthQwen3 实测性能数据数据取自官方审计配置Qwen3.8-2.4T-A95B MoEFP8GB300 集群输入8192/ 输出1024token聚合部署部署模式并行拓扑MTP3 投机并发实测吞吐低延迟TP16/EP1关1133.5 tokens/s/用户低延迟TP16/EP1草稿长 31383.1 tokens/s/用户高吞吐TP32/EP32静态 EPLB关32644059.2 tokens/s/GPU高吞吐TP32/EP32静态 EPLB草稿长 323044118.2 tokens/s/GPUMTP3 把单流中位 TPOT 从 7.491ms 压到2.611ms单用户输出速度提升约2.9 倍高吞吐模式下 MTP3 再叠加1.4%的每卡输出增益。参数速查与避坑参数作用建议值max_batch_size动态批处理并发上限161官方默认max_num_tokens单批总 token 数1160enable_attention_dp注意力数据并行高吞吐前提trueKV 缓存空闲显存比例权重加载后留给 KV 缓存的显存占比0.8OOM 降到 0.7✅ MoE 模型必须把moe_expert_parallel_size设为 GPU 数30B-A3B 才能把专家切到多卡否则显存放不下。 ✅ 首条请求别计入性能基线它含初始化与编译延迟系统性偏高。 ✅ 8000 端口被占用会直接起服失败启动前用--port换一个空闲端口。常见报错速查Q报 CUDA out of memoryA调低max_batch_size、max_num_tokensKV 缓存比例降到 0.7 以下图捕获阶段 OOM 再降图的 batch 上限。Q单卡显存不够跑 30B-A3BA换nvidia/Qwen3-8B-FP8量化权重FP8 把权重显存约减半一条trtllm-serve命令即可拉起。QQwen3 系列哪些尺寸能用A稠密 0.6B/1.7B/4B/8B/14B/32BMoE 30B-A3B 与 235B-A22B 均官方支持完整清单见 模型支持矩阵。只记一条就够用官方 curated 配置起服务再按并发画像叠加 MTP3 与专家并行收益全是实测数字。更多细节看 Qwen3 部署指南、官方调优配置和 Qwen3 示例文档。【免费下载链接】TensorRT-LLMTensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C runtimes that orchestrate the inference execution in a performant way.项目地址: https://gitcode.com/GitHub_Trending/te/TensorRT-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考