SemiAnalysis InferenceMAX:vLLM 与 NVIDIA 加速 Blackwell 推理
简介
在过去的几个月里,我们与 NVIDIA 密切合作,利用 vLLM 充分释放其最新的 NVIDIA Blackwell GPU 架构(B200/GB200)在大语言模型推理方面的潜力。Blackwell GPU 引入了全新层级的性能和效率改进,例如更高的内存带宽和原生的 FP4 张量核心,为加速推理工作负载创造了令人兴奋的机会。
Blackwell 开箱即用即可提供出色的性能,但为了从硬件中榨取更多潜能,我们的联合优化重构了现有内核,并针对更底层的硬件利用率开发了新的内核,从而进一步提升了性能和效率。全新的 SemiAnalysis InferenceMAX 基准测试反映了这些改进,证明了在流行的模型(如 gpt-oss 120B 和 Llama 3.3 70B)上,vLLM 在 Blackwell 上的性能较上一代 Hopper GPU 实现了最高 4 倍的吞吐量提升,同时保持了相当的延迟。
这项工作是一项长达数月的工程协作,涉及 vLLM 代码库中的上百个拉取请求(Pull Requests)。我们与 NVIDIA 一起优化了推理管道的几乎每一个部分——从自定义内核(Attention、GEMM、MoE)到高级调度和开销消除。本博客详细介绍了这些优化,以及它们如何将 Blackwell 的架构特性转化为生产中的性能增益。
InferenceMax 概览
SemiAnalysis InferenceMax 是一个基准测试框架,旨在进行自动化、周期性的 LLM 服务性能测试,其结果每日更新以反映软件性能的变化。这种方法通过一致的测试方法论,确保了公平、可复现的比较,缩小了软件更新与已发布基准数据之间的差距。
InferenceMAX 目前使用两种具有代表性的开源模型对 vLLM 进行评估:
- 混合专家模型(MoE):gpt-oss 120B
- 稠密模型(Dense):Llama 3.3 70B
为了模拟真实世界的使用场景,基准测试在各种提示/响应长度场景(ISL = 输入序列长度,OSL = 输出序列长度)下运行每个模型。具体而言,测试涵盖了三种模式:
- 1K ISL / 1K OSL(聊天,中等输入/输出)
- 1K ISL / 8K OSL(推理,长输出)
- 8K ISL / 1K OSL(摘要,长输入)
跨帕累托前沿提供卓越性能
Blackwell 的新型计算架构带来了推理效率的跨越式提升,它采用了最新的 HBM3e 内存(每块 B200 配备 192 GB HBM3e,带宽达 8 TB/s)、高 NVLink 数据传输速度(每 GPU 1.8 TB/s),并内置了对 FP4 精度格式的支持以及第五代张量核心。
通过对内核进行适配以充分挖掘这些先进特性,与在之前的 Hopper 架构上运行 vLLM 相比,我们在吞吐量(单 GPU 性能)和响应速度(单请求延迟)方面都看到了显著的增长。
现代推理工作负载在序列长度、批处理大小和并发性方面差异巨大。能够产生最高吞吐量的配置往往不是实现最低每用户延迟的配置。因此,单一指标可能会产生误导。SemiAnalysis InferenceMAX 应用了帕累托前沿方法论(Pareto frontier methodology)来评估响应速度与吞吐量之间的权衡,描绘了 Blackwell 在真实操作条件下的性能边界。
我们与 NVIDIA 合作的主要目标是确保 vLLM 能够利用 Blackwell 的特性,在整个帕累托前沿实现卓越性能。
我们很高兴地看到,SemiAnalysis 基准测试结果显示,与上一代 Hopper 架构相比,在 gpt-oss 120B 和 Llama 3.3 70B 模型的所有交互水平上,vLLM 在 Blackwell 上的性能均有一致的提升。

图 1:SemiAnalysis InferenceMax gpt-oss-120b 帕累托前沿,比较了在广泛交互范围内 1k/1k ISL/OSL 配置下 vLLM 在 Blackwell 和 Hopper 上的性能。结果显示,在 Blackwell 上使用 vLLM 的吞吐量比 Hopper 高出 4.3 倍。

图 2:SemiAnalysis InferenceMax Llama 3.3 70B 帕累托前沿,比较了在广泛交互范围内 1k/8k ISL/OSL 配置下 vLLM 在 Blackwell 和 Hopper 上的性能。结果显示,在 Blackwell 上使用 vLLM 的吞吐量比 Hopper 高出 3.7 倍。
这些性能提升在今天即可复现,使用 SemiAnalysis 提供的 InferenceMAX 配置即可实现。这证明了当专注于从硬件中榨取最大价值时,优化的软件所能达到的成就。实现这些数字需要对 vLLM 进行广泛的优化,这些优化是在与 NVIDIA 工程师的深度合作下开发的。接下来,我们将概述其中最重要的部分。
vLLM Blackwell 优化
在 Blackwell 上实现上述性能涉及软件栈各个层面的工作。一些优化改善了 GPU 上的原始内核执行速度,而另一些则减少了 CPU 开销或更好地利用了硬件功能。以下是 vLLM 中为支持 Blackwell 而引入的关键增强功能:
性能改进
- 通过 FlashInfer 获得更快的内核: 我们集成了 NVIDIA 的 FlashInfer 库,以纳入许多高性能内核,包括用于 GQA 和 MLA 的 FP8 注意力机制、快速 FP8 和 FP4 GEMM、MoE 内核以及融合算子。例如,我们将 AllReduce、RMSNorm 和量化合并在单个内核启动中,从而显著降低了延迟。我们利用了 NVIDIA 软件栈中广泛的内核,包括 CUTLASS、CuTeDSL、cuBLAS、cuDNN 和 TRTLLM。
- 更智能的图融合(Graph Fusions): 将 vLLM 的 torch.compile 图融合扩展到包括注意力机制 + 输出量化(Attention + Output Quant)以及 AllReduce + RMSNorm + 量化(AllReduce + RMSNorm + Quant)等算子模式,无需手动修改模型即可提供融合内核性能,最重要的是,这在各种模型架构上具有普适性。
- 通过异步调度减少主机开销:
--async-scheduling现已实现模型执行与主机开销的完全重叠,消除了之前因同步导致的 GPU 空闲时间。这实现了工作负载的完全流水线化,因此当一个批次在 GPU 上进行推理时,下一个批次的数据会并行准备就绪。
易用性改进
- 自动量化与后端选择: vLLM 会自动检测模型是否正在使用量化,从而选择合适的后端,并为您的 GPU 选择最佳的注意力机制后端。例如,在 Blackwell 上,vLLM 会在可用时选择基于 FlashInfer 的注意力机制(结合了 NVIDIA 的 TensorRT-LLM 内核),或根据需要回退到 FlashAttention,无需手动设置标志或调整环境。
- FlashInfer GEMM 和 MoE 的自动调优: 由于理想的内核实现很大程度上取决于批处理大小和序列长度,我们在 vLLM 的 GPU 运行器中添加了自动调优机制。启动期间,FlashInfer 将通过基准测试和选择内核来进行自动策略选择,确保即使在推理过程中 ISL/OSL 发生变化,也能保持峰值性能。
- 快速入门指南(Quick Start Recipes),助力轻松进行优化部署: 除了代码更改外,我们还与社区合作,针对常见场景提供了快速配置指南。针对特定硬件上每个模型的清晰说明,指导用户使用推荐设置启动服务器、调整参数、验证准确性并进行性能基准测试,从而简化设置并加快获得结果的时间。
持续进行的工作
上述每项优化本身都是一项重大工程,需要密切的技术协作——而且我们还没有完全列举完!我们与 NVIDIA 的合作正在进行中,前方还有大量等待实现的改进。
展望未来,我们正致力于通过投机采样(speculative decoding)和数据+专家并行(Data+Expert Parallel, DEP)配置,在 DeepSeek、Qwen、gpt-oss 等模型上释放集群规模推理的巨大吞吐量增益。利用 NVIDIA 的 gpt-oss-120b-Eagle3-v2(它集成了 Eagle 投机采样),我们预计吞吐量将提升约 2-3 倍。利用 DEP(它利用了 Blackwell 中 1,800 GB/s 的低延迟 NVLINK GPU 到 GPU 互联),我们期望在 InferenceMax 基准测试的基础上进一步释放性能并实现更高的并发性,从而为更快、更高效的推理铺平道路。
在 vLLM 与 NVIDIA 的持续优化与合作推动下,Blackwell 上的性能改进每天都在发生。我们正在不断发现新的机会,以推动 Blackwell 平台在效率和规模方面的极限。
致谢
我们要感谢 vLLM 社区中许多有才华的人,他们为这一努力共同做出了贡献。
- Red Hat:Michael Goin, Alexander Matveev, Lucas Wilkinson, Luka Govedič, Wentao Ye, Ilia Markov, Matt Bonanni, Varun Sundar Rabindranath, Bill Nell, Tyler Michael Smith, Robert Shaw
- NVIDIA:Po-Han Huang, Pavani Majety, Shu Wang, Elvis Chen, Zihao Ye, Duncan Moss, Kaixi Hou, Siyuan Fu, Benjamin Chislett, Xin Li, Vadim Gimpelson, Minseok Lee, Amir Samani, Elfie Guo, Lee Nau, Kushan Ahmadian, Grace Ho, Pen Chun Li
- vLLM:Chen Zhang, Yongye Zhu, Bowen Wang, Kaichao You, Simon Mo, Woosuk Kwon, Zhuohan Li
- Meta:Yang Chen, Xiaozhu Meng, Boyuan Feng, Lu Fang
您可以在 http://inferencemax.ai 找到所有的 InferenceMax 结果。运行这些测试的代码已在 https://github.com/InferenceMAX/InferenceMAX 开源。关于结果的详细解释可以在 https://newsletter.semianalysis.com/p/inferencemax-open-source-inference 找到。
我们衷心感谢 SemiAnalysis 团队将硬件与开源软件的协同设计推向了新的高度,旨在为社区提供公平的衡量和比较。感谢 Kimbo Chen、Dylan Patel 等人。
我们很高兴能继续完善和扩展我们的优化,在未来的几周和几个月内解锁更强大的能力!