vLLM 登顶 Artificial Analysis 排行榜

15 分钟阅读
vLLM 团队

vLLM 如何构建了 DeepSeek V3.2、MiniMax-M2.5 和 Qwen 3.5 397B 的领先部署方案。

上周,DigitalOcean 发布了推理基准测试结果,涵盖了三款前沿的开源权重模型。在 DeepSeek V3.2 上,部署实现了每用户 230 TPS 的最佳输出吞吐量,是大多数推理提供商对同一模型所报告速度的 4 倍以上。在 Qwen 3.5 397B 的发布中,它在 Artificial Analysis 测量的全部 12 家提供商中排名第一,处理 10,000 个 token 的提示词时首字延迟 (TTFT) 低于 1 秒。

值得注意的是:底层的引擎是开源的,它就是 vLLM。

生产环境 AI 中的一个普遍假设是,最佳的推理性能需要专有技术栈。然而在这种情况下,一个由社区构建的推理引擎,在相同的 NVIDIA Blackwell Ultra 芯片上运行,却夺得了第一名。

这些结果背后的优化并非锁定在私有分支中。针对 DeepSeek V3.2 的算子融合、用于 MiniMax-M2.5 的自定义 EAGLE3 草稿模型,以及一组针对 Qwen 3.5 线性注意力路径调整的融合优化,每一项更改要么已经合并到 vLLM 主分支,要么正在添加过程中。

本文将介绍此部署是如何构建的。

vLLM 如何实现高速推理

工作拆解为三个模型,每个模型都有其瓶颈和相应的解决方案。

  1. DeepSeek V3.2:激进的算子融合以减少低批处理大小下的开销(同样适用于 DeepSeek V4)。
  2. MiniMax-M2.5:针对性的算子融合,搭配自定义的 EAGLE3 草稿模型——尽管模型本身是定制的,但它是使用开源的 TorchSpec 和 vLLM 训练的。该草稿模型同样适用于 M2.7,因为架构是完全相同的。
  3. Qwen 3.5 397B:针对模型注意力及归一化路径的针对性融合。

以下章节将依次详细介绍每个模型。

DeepSeek V3.2:低批处理大小下的算子融合

在低批处理大小时,DeepSeek V3.2 的瓶颈在于 GPU 算子启动开销,而非计算能力。每个 Transformer 层会发出数十个独立的算子——例如归一化、旋转位置编码 (RoPE) 和量化等小操作。虽然 GPU 执行这些操作只需微秒级,但每个操作的固定启动成本却占据了总时间的主要部分。

解决方案是进行注意力路径的算子融合。原本作为独立算子启动的操作——Q 和 KV 归一化、Q 和 KV 的旋转编码、索引器的层归一化和旋转编码、FP8 量化以及 KV 缓存写入——被压缩为一对涵盖注意力机制和 MoE 之外所有操作的融合算子。每层的算子数量从约 33 个降低到了目标 10 个左右。

Figure 1: DSv3.2 attention-path fusion collapses ~33 per-layer kernel launches into ~10, yielding a 1.28× speedup at batch size 1.
图 1:DSv3.2 注意力路径融合将每层约 33 次算子启动压缩为约 10 次,在批处理大小为 1 时实现了 1.28 倍的加速。

仅此融合就使批处理大小为 1 时实现了 1.28 倍的加速(在 4× GB200 上,无 MTP 时从 85.8 提升至 109.3 tok/s)。在单节点 8× B300 上,并发度为 1 时:

  • 无 MTP (TP=8):125 tok/s
  • 开启 MTP=1 (TP=8):234 tok/s(约 90% 的草稿采纳率)
  • 预填充/解码分离 (TP=4 + TP=4 + MTP=3):262 tok/s

除了融合之外,两个特定于 DSv3.2 的算子填补了剩余的缺口。一个新的路由器 GEMM 算子——专门针对 DSv3 的 MoE 路由维度在小解码批处理大小下进行了优化——取代了通用矩阵乘法,并在批处理大小为 1 时额外提升了 6% 的速度 (#34302)。

对于稀疏注意力索引器,一个新的 TopK 算子根据序列长度为每一行选择合适的算法,将所有情况整合进单个 CUDA 图中。这为 128K 上下文解码带来了高达 17% 的每 token 延迟优化 (#37421)。

这项工作现在构成了 vLLM DeepSeek V4 支持 的基础,该支持复用了此项工作中的 Q RoPE + 量化和 QK 归一化融合。结果如下所示。

Figure 2: DeepSeek V3.2 Non-Reasoning, output speed across providers.
图 2:DeepSeek V3.2 非推理模型,各提供商的输出速度。

来源:Artificial Analysis,2026 年 5 月。

Figure 3: DeepSeek V3.2 Reasoning, output speed across providers.
图 3:DeepSeek V3.2 推理模型,各提供商的输出速度。

来源:Artificial Analysis,2026 年 5 月。

MiniMax-M2.5:EAGLE3 与更多的算子融合

Inferact 团队使用 TorchSpec 为 MiniMax-M2.5 训练了一个自定义的 EAGLE3 草稿模型。TorchSpec 是一个原生于 PyTorch 的在线推测解码框架,支持同时运行 FSDP 草稿训练和基于 vLLM 的目标推理。该草稿模型并非从通用监督数据集学习,而是通过消费 vLLM 生成的实时隐藏状态来匹配基模型精确的 token 分布。

vLLM 的 MRV2 路径中推测解码基础设施的改进使这一切成为可能:一项草稿模型元数据修复改善了后续草稿位置的采纳率 (#38311),以及对草稿预填充的 CUDA 图支持 (#37588)。

除了草稿模型,MiniMax M2.5 还进行了针对性的算子融合。添加了一个自定义的 QK-norm 融合 (fuse_minimax_qk_norm),以处理该模型非标准的注意力归一化,即在应用每通道缩放前,Q 和 K 的方差在张量并行秩之间进行归约 (#37045)。

Figure 4: Anatomy of fuse_minimax_qk_norm across four tensor-parallel ranks.
图 4:跨四个张量并行秩的 fuse_minimax_qk_norm 解构。

在启用此融合以及标准的 fuse_norm_quantfuse_act_quantfuse_gemm_comms 通路后,上限测试达到:

  • 并发度 1 时 326 tok/s (TP=4, EAGLE3 + 3 个推测 token,合成 100% 采纳率)。

这代表了该服务堆栈在拥有完美草稿模型情况下的上限,从而将算子融合的贡献与草稿模型质量隔离开来。

Figure 5: MiniMax-M2.5, output speed across providers.
图 5:MiniMax-M2.5,各提供商的输出速度。

来源:Artificial Analysis,2026 年 5 月。

Qwen 3.5 397B:线性注意力与融合缺口

Qwen 3.5 在其注意力块中使用了带有非标准归一化的线性注意力。这两种架构选择与 vLLM 的标准融合基础设施交互时表现不佳:投影后卷积路径是线性注意力模型特有的,且归一化变体与 vLLM 现有的 allreduce_rms 融合匹配模式不符。

这种成本在性能分析器中显现出来。由于错过了 allreduce_rms 融合,解码时间约一半花费在非融合的跨设备规约上——这正是融合本应消除的开销类型。模型运行正常且结果准确,但引擎执行了多于必要的内存往返。

四项工作弥补了这一差距:

  • 修复现有的 allreduce_rms 融合通道以识别 Qwen 的归一化变体——在批处理 > 1 时 TPOT 提升约 5%。
  • 针对 qk-norm + rope 路径进行内核级优化。
  • 针对 Qwen 线性注意力架构特定的后卷积路径进行算子融合 (#37813)。
  • 双流执行以重叠独立的计算分支。
Figure 6: Qwen 3.5 397B kernel fusion work in vLLM.
图 6:vLLM 中的 Qwen 3.5 397B 算子融合工作。

结合 TP=8 + 专家并行,生产部署达到:

  • 并发度 1 时 163 tok/s (TEP=8,开启后卷积融合)
  • 并发度 256 时 7.33 req/s,高于基准 6.69 req/s (+10%)

此项工作已发布在 vLLM 主分支中。

Figure 7: Qwen 3.5 397B, output speed across providers.
图 7:Qwen 3.5 397B,各提供商的输出速度。

来源:Artificial Analysis,2026 年 5 月。

这对 vLLM 意味着什么

这些结果背后的优化——DSv3.2 注意力路径融合、MiniMax EAGLE3 草稿模型训练方案以及 Qwen 3.5 融合——要么已经合并到 vLLM 主分支,要么正在合并途中。在当前 vLLM 上运行这些模型的团队将获得同样的加速效果。

开源的首选方案

从历史上看,最快的推理堆栈一直属于专有技术——由超大规模企业、模型实验室和芯片供应商为其自身基础设施构建和调优。开源替代方案虽然应用广泛,但在生产性能上往往滞后。

在推理层面,这种状况已不再成立。vLLM 现在在 Artificial Analysis 排行榜上针对其支持的模型占据了榜首。在这些基准测试中,世界上最快的推理是开源的。现代 AI 的底层基础设施正在紧随其后。

致谢

感谢 Inferact、DigitalOcean、NVIDIA、Red Hat 以及 vLLM 开源社区对此倡议的贡献。