vLLM 现在支持 Qwen3-Next:具备极致效率的混合架构
我们非常高兴地宣布,vLLM 现已支持 Qwen3-Next,这是 Qwen 团队推出的最新一代基础模型。Qwen3-Next 引入了一种具备极致效率的混合架构,可支持长上下文,而 vLLM 已全面支持其各项功能。

在本文中,我们将深入探讨 Qwen3-Next 的创新点——混合注意力、高稀疏度 MoE 和多 Token 预测,并展示 vLLM 如何高效地支持它们。
快速入门
你可以使用 vLLM 的 nightly 版本运行 Qwen3-Next:
uv pip install vllm --extra-index-url https://wheels.vllm.ai/nightly --torch-backend=auto
然后启动:
vllm serve Qwen/Qwen3-Next-80B-A3B-Instruct -tp 4
请参阅 vLLM 模型配置指南以获取更详细的安装和使用说明。
混合注意力:高效的上下文建模
Qwen3-Next 的核心在于其混合注意力 (Hybrid Attention) 设计,它用以下组合取代了标准的注意力机制:
- Gated DeltaNet(用于长上下文效率的线性注意力)
- 完整注意力 (Full Attention)(用于高保真推理的完整注意力)
该模型在不同层之间交替使用这两种注意力形式,从而能够高效地扩展到 65K 及更长的上下文长度。
为了支持这一点,vLLM 集成了来自 Flash Linear Attention 的 Triton 内核,并采用了混合 KV 缓存管理器来管理线性注意力层和完整注意力层,从而避免内存碎片并最大限度地提高 GPU 利用率。
为了管理像 Qwen3-Next 这类混合模型的状态,vLLM 会自动调整完整注意力层的“逻辑”块大小,以确保完整注意力层和线性注意力层的状态占用相同数量的“物理”GPU 内存。这使得混合模型能够实现简单且高效的分页内存管理,在 GPU 内存饱和的繁重工作负载下提高吞吐量。

此外,Flash Linear Attention 基于 Triton 构建。启动 Triton 内核会产生大量的 CPU 开销,这对纯解码批次(decode-only batches)的影响尤为显著。为解决这一问题,vLLM 默认启用了完整的 CUDA Graph 模式,从而确保在低延迟场景下的优异性能。
高稀疏度 MoE:极致效率
Qwen3-Next 通过激活比为 1:50 的 MoE 层进一步提升了稀疏性。在旗舰级的 80B-A3B 模型中,每个 Token 仅有 3B 参数被激活。借助内置的高效 MoE 实现,vLLM 可以获得卓越的吞吐量和延迟表现。
多 Token 预测 (MTP)
Qwen3-Next 的另一项创新是多 Token 预测,它同时提升了预训练效率和推理速度。vLLM 原生支持此模式,允许 Qwen3-Next 在每一步解码多个 Token,而无需修改应用程序代码。请查看配置指南了解如何使用。
展望未来
Qwen3-Next 的集成只是一个开始。我们未来的路线图包括:
- 针对 GatedDeltaNet 层进行进一步的内核优化。
- 改进内存管理,并支持混合模型的自动前缀缓存 (Automatic Prefix Caching) 和 P/D 分离。
- 持续提升吞吐量并进一步降低 CPU 开销。
致谢
这项工作的顺利完成离不开与众多合作伙伴的紧密协作:
- Qwen 团队:包括陶贺、张建伟等,感谢他们开源了该模型。
- Flash Linear Attention 团队:包括张宇等,感谢他们审查了 Gated DeltaNet 注意力内核并改善了数值稳定性。
- NVIDIA:包括 Vadim Gimpelson,感谢其对模型的测试工作。
- IBM Research:包括 Thomas Parnell,感谢其在混合内存管理和 CUDA Graph 优化方面的工作。
- Red Hat:包括 Tyler Michael Smith、Doug Smith、Tarun Kumar 和 Elvir Crncevic,感谢他们对模型的测试以及对 MoE 内核的调优。
- 社区合作伙伴:Meta、Roblox 等,感谢他们提供的测试、反馈和扩展洞察。
参与此项工作的 vLLM 团队成员包括:Jie Li, Kaichao You, Chen Zhang, Simon Mo。
👉 Qwen3-Next 现已在 vLLM 中可用。立即试用,体验最新混合 MoE 架构带来的超高效长上下文推理。