Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试

发布时间:2026/7/22 15:26:59
Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试 Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型采用 Mixture-of-ExpertsMoETransformer 架构支持文本、图像和音频等多模态输入并生成文本输出。模型拥有约 975B 总参数、41B 激活参数并支持最长 1M token 上下文窗口。在能力方面Inkling 面向通用智能、Agent、工具调用以及复杂推理任务进行了优化同时支持 MTPMulti-Token Prediction等推理加速技术可结合 vLLM、SGLang 等主流推理引擎进行部署。1. 登录 GPUStack 选择推理后端测试环境8 × H20-141G2. 添加版本点击添加版本Add Version镜像名称vllm/vllm-openai:nightly3. 点击部署开始部署Node 0 参数--trust-remote-code --tokenizer-modeinkling --kernel-config.enable_flashinfer_autotuneFalse --tensor-parallel-size8--data-parallel-size2--data-parallel-size-local1--enable-expert-parallel --data-parallel-rpc-port13389--data-parallel-address10.91.3.213 --data-parallel-hybrid-lb --max-model-len131072--max-num-seqs10--enable-auto-tool-choice --tool-call-parserinkling --speculative-config{method:mtp,num_speculative_tokens:1}--reasoning-parserinkling环境变量PYPI_PACKAGES_INSTALLscipy1.18.0-ihttps://mirrors.aliyun.com/pypi/simple/Node 1 参数--trust-remote-code --tokenizer-modeinkling --kernel-config.enable_flashinfer_autotuneFalse --tensor-parallel-size8--data-parallel-size2--data-parallel-size-local1--data-parallel-start-rank1--enable-expert-parallel --data-parallel-rpc-port13389--data-parallel-address10.91.3.213 --data-parallel-hybrid-lb --max-model-len131072--max-num-seqs10--enable-auto-tool-choice --tool-call-parserinkling --speculative-config{method:mtp,num_speculative_tokens:1}--reasoning-parserinkling环境变量PYPI_PACKAGES_INSTALLscipy1.18.0-ihttps://mirrors.aliyun.com/pypi/simple/模型进入 Running 状态后可以直接通过 GPUStack 试验场进行交互测试。在默认配置下Inkling 输出速度达到80 Tokens/s能够正常完成多轮文本对话并支持思考过程解析。同时支持原生多模态能力。4. 测评测试配置Input Length64KOutput Length3KRequests10测试结果如下指标结果Output Token Throughput56.10 tok/sPeak Output Throughput78.00 tok/sTotal Token Throughput1253.09 tok/sMean TTFT92.77sMean TPOT97.09 ms/token在长上下文输入场景下Inkling 可以稳定完成 64K 上下文推理任务并保持持续输出能力。