vLLM 登顶 Artificial Analysis 排行榜

vLLM 如何构建了 DeepSeek V3.2、MiniMax-M2.5 和 Qwen 3.5 397B 的领先部署方案。
上周,DigitalOcean 发布了推理基准测试结果,涵盖了三款前沿的开源权重模型。在 DeepSeek V3.2 上,部署实现了每用户 230 TPS 的最佳输出吞吐量,是大多数推理提供商对同一模型所报告速度的 4 倍以上。在 Qwen 3.5 397B 的发布中,它在 Artificial Analysis 测量的全部 12 家提供商中排名第一,处理 10,000 个 token 的提示词时首字延迟 (TTFT) 低于 1 秒。
值得注意的是:底层的引擎是开源的,它就是 vLLM。
生产环境 AI 中的一个普遍假设是,最佳的推理性能需要专有技术栈。然而在这种情况下,一个由社区构建的推理引擎,在相同的 NVIDIA Blackwell Ultra 芯片上运行,却夺得了第一名。
这些结果背后的优化并非锁定在私有分支中。针对 DeepSeek V3.2 的算子融合、用于 MiniMax-M2.5 的自定义 EAGLE3 草稿模型,以及一组针对 Qwen 3.5 线性注意力路径调整的融合优化,每一项更改要么已经合并到 vLLM 主分支,要么正在添加过程中。
本文将介绍此部署是如何构建的。
vLLM 如何实现高速推理
工作拆解为三个模型,每个模型都有其瓶颈和相应的解决方案。
- DeepSeek V3.2:激进的算子融合以减少低批处理大小下的开销(同样适用于 DeepSeek V4)。
- MiniMax-M2.5:针对性的算子融合,搭配自定义的 EAGLE3 草稿模型——尽管模型本身是定制的,但它是使用开源的 TorchSpec 和 vLLM 训练的。该草稿模型同样适用于 M2.7,因为架构是完全相同的。
- Qwen 3.5 397B:针对模型注意力及归一化路径的针对性融合。
以下章节将依次详细介绍每个模型。
DeepSeek V3.2:低批处理大小下的算子融合
在低批处理大小时,DeepSeek V3.2 的瓶颈在于 GPU 算子启动开销,而非计算能力。每个 Transformer 层会发出数十个独立的算子——例如归一化、旋转位置编码 (RoPE) 和量化等小操作。虽然 GPU 执行这些操作只需微秒级,但每个操作的固定启动成本却占据了总时间的主要部分。
解决方案是进行注意力路径的算子融合。原本作为独立算子启动的操作——Q 和 KV 归一化、Q 和 KV 的旋转编码、索引器的层归一化和旋转编码、FP8 量化以及 KV 缓存写入——被压缩为一对涵盖注意力机制和 MoE 之外所有操作的融合算子。每层的算子数量从约 33 个降低到了目标 10 个左右。

仅此融合就使批处理大小为 1 时实现了 1.28 倍的加速(在 4× GB200 上,无 MTP 时从 85.8 提升至 109.3 tok/s)。在单节点 8× B300 上,并发度为 1 时:
- 无 MTP (TP=8):125 tok/s
- 开启 MTP=1 (TP=8):234 tok/s(约 90% 的草稿采纳率)
- 预填充/解码分离 (TP=4 + TP=4 + MTP=3):262 tok/s
除了融合之外,两个特定于 DSv3.2 的算子填补了剩余的缺口。一个新的路由器 GEMM 算子——专门针对 DSv3 的 MoE 路由维度在小解码批处理大小下进行了优化——取代了通用矩阵乘法,并在批处理大小为 1 时额外提升了 6% 的速度 (#34302)。
对于稀疏注意力索引器,一个新的 TopK 算子根据序列长度为每一行选择合适的算法,将所有情况整合进单个 CUDA 图中。这为 128K 上下文解码带来了高达 17% 的每 token 延迟优化 (#37421)。
这项工作现在构成了 vLLM DeepSeek V4 支持 的基础,该支持复用了此项工作中的 Q RoPE + 量化和 QK 归一化融合。结果如下所示。

来源:Artificial Analysis,2026 年 5 月。

来源:Artificial Analysis,2026 年 5 月。
MiniMax-M2.5:EAGLE3 与更多的算子融合
Inferact 团队使用 TorchSpec 为 MiniMax-M2.5 训练了一个自定义的 EAGLE3 草稿模型。TorchSpec 是一个原生于 PyTorch 的在线推测解码框架,支持同时运行 FSDP 草稿训练和基于 vLLM 的目标推理。该草稿模型并非从通用监督数据集学习,而是通过消费 vLLM 生成的实时隐藏状态来匹配基模型精确的 token 分布。
vLLM 的 MRV2 路径中推测解码基础设施的改进使这一切成为可能:一项草稿模型元数据修复改善了后续草稿位置的采纳率 (#38311),以及对草稿预填充的 CUDA 图支持 (#37588)。
除了草稿模型,MiniMax M2.5 还进行了针对性的算子融合。添加了一个自定义的 QK-norm 融合 (fuse_minimax_qk_norm),以处理该模型非标准的注意力归一化,即在应用每通道缩放前,Q 和 K 的方差在张量并行秩之间进行归约 (#37045)。

在启用此融合以及标准的 fuse_norm_quant、fuse_act_quant 和 fuse_gemm_comms 通路后,上限测试达到:
- 并发度 1 时 326 tok/s (TP=4, EAGLE3 + 3 个推测 token,合成 100% 采纳率)。
这代表了该服务堆栈在拥有完美草稿模型情况下的上限,从而将算子融合的贡献与草稿模型质量隔离开来。

来源:Artificial Analysis,2026 年 5 月。
Qwen 3.5 397B:线性注意力与融合缺口
Qwen 3.5 在其注意力块中使用了带有非标准归一化的线性注意力。这两种架构选择与 vLLM 的标准融合基础设施交互时表现不佳:投影后卷积路径是线性注意力模型特有的,且归一化变体与 vLLM 现有的 allreduce_rms 融合匹配模式不符。
这种成本在性能分析器中显现出来。由于错过了 allreduce_rms 融合,解码时间约一半花费在非融合的跨设备规约上——这正是融合本应消除的开销类型。模型运行正常且结果准确,但引擎执行了多于必要的内存往返。
四项工作弥补了这一差距:
- 修复现有的
allreduce_rms融合通道以识别 Qwen 的归一化变体——在批处理 > 1 时 TPOT 提升约 5%。 - 针对 qk-norm + rope 路径进行内核级优化。
- 针对 Qwen 线性注意力架构特定的后卷积路径进行算子融合 (#37813)。
- 双流执行以重叠独立的计算分支。

结合 TP=8 + 专家并行,生产部署达到:
- 并发度 1 时 163 tok/s (TEP=8,开启后卷积融合)
- 并发度 256 时 7.33 req/s,高于基准 6.69 req/s (+10%)
此项工作已发布在 vLLM 主分支中。

来源:Artificial Analysis,2026 年 5 月。
这对 vLLM 意味着什么
这些结果背后的优化——DSv3.2 注意力路径融合、MiniMax EAGLE3 草稿模型训练方案以及 Qwen 3.5 融合——要么已经合并到 vLLM 主分支,要么正在合并途中。在当前 vLLM 上运行这些模型的团队将获得同样的加速效果。
开源的首选方案
从历史上看,最快的推理堆栈一直属于专有技术——由超大规模企业、模型实验室和芯片供应商为其自身基础设施构建和调优。开源替代方案虽然应用广泛,但在生产性能上往往滞后。
在推理层面,这种状况已不再成立。vLLM 现在在 Artificial Analysis 排行榜上针对其支持的模型占据了榜首。在这些基准测试中,世界上最快的推理是开源的。现代 AI 的底层基础设施正在紧随其后。
致谢
感谢 Inferact、DigitalOcean、NVIDIA、Red Hat 以及 vLLM 开源社区对此倡议的贡献。