
走进 vLLM:高吞吐量 LLM 推理系统的剖析
在这篇文章中,我将逐步介绍构成现代高吞吐量 LLM 推理系统的所有核心组件和高级功能。特别是,我将进行详细拆解……
深入探讨推理工程、性能突破、新模型支持以及来自 vLLM 社区的最新动态。

在这篇文章中,我将逐步介绍构成现代高吞吐量 LLM 推理系统的所有核心组件和高级功能。特别是,我将进行详细拆解……

我们很高兴与 Red Hat 和吴恩达的 DeepLearning.AI 共同宣布推出一门实践课程,该课程将深入讲解 LLM 基础知识,以及完整的 AI 部署生命周期(包括优化、部署和基准测试)...

长视域 LLM 代理产生了一个路由问题,单轮提示路由器并不能解决该问题。路由器仍然需要知道哪种模型最适合当前的请求,但它还需要……

我们很高兴地宣布,Intel 的最先进后训练量化 (PTQ) 算法 —— AutoRound 已完全集成到 vLLM-Omni 中,实现了精简的“量化一次”工作流……

深入探讨在 NVIDIA DGX Spark 和 GB10 系统上运行 vLLM 的技术细节,内容涵盖 sm_121 架构、统一内存行为、NVFP4 模型服务、Nemotron-3-Super 配置、Docker 部署、Prometheus 指标以及本地评估结果。

随着各机构越来越多地采用 AI 驱动的开发工具,对兼具准确性和运行效率的高性能智能体模型的需求变得至关重要。Laguna...
随着后训练工作负载的持续扩大,我们见证了 vLLM 作为首选推理引擎被广泛采用。然而,有两个问题反复出现

v0.5.0 版本在推测解码模型训练方面带来了重大的架构改进,引入了 DFlash 算法支持、完全统一的在线训练能力,以及...

大多数路由系统从提示词开始并选择模型端点。vLLM 语义路由器 (VSR) 做出了不同的押注:在请求到达服务模型之前,系统应提取...

EAGLE 系列(包括 EAGLE 1、EAGLE 2 和 EAGLE 3)已成为研究和实际部署中最广泛采用的投机采样算法家族之一...

摘要:通过与 Novita AI 合作,PegaFlow 作为用于 LLM 推理的外部 KV 缓存服务集成到 vLLM 中,它作为一个独立的 Rust 进程实现,并通过外部接口连接...

专家并行(EP)是实现混合专家模型(MoE)高吞吐推理的关键技术。宽 EP 部署(其中 EP 跨越多个工作节点)可最大化 KV 缓存容量,从而……

我们很高兴地宣布发布 VeRL-Omni 的预发布版本。这是一个专注于多模态生成模型的通用强化学习 (RL) 后训练框架,构建在 verl 和 vllm-omni 之上。

TurboQuant 是一种 KV 缓存量化方法,最近因其通过超低比特位量化而带来的巨大显存节省,在社区中获得了广泛关注...

vLLM 如何构建了 DeepSeek V3.2、MiniMax-M2.5 和 Qwen 3.5 397B 的领先部署方案。
TL;DR:智能体工作负载会生成大量共享前缀,这些前缀通常在不同轮次间反复计算。通过将 Mooncake 的分布式 KV 缓存存储集成到 vLLM,我们实现了 3.8 倍的吞吐量提升……

我们很高兴 vLLM 能够支持新发布的 NVIDIA Nemotron 3 Nano Omni 模型。
关于 DeepSeek V4 长上下文注意力机制的原理性解读,以及我们在 vLLM 中的实现方式。

长上下文 LLM 推理正日益受到内存瓶颈的限制:对于标准的完整注意力解码器,在上下文超过 128k 时,KV 缓存往往会占据大部分 GPU 内存,且每个解码步骤都必须读取大量...

将 Mamba 风格的 SSM 层与标准全注意力 (FA) 层交错的混合架构(例如 NVIDIA Nemotron-H)正日益受到关注,这被视为结合线性时间复杂度...

vLLM 韩国聚会 2026 于 4 月 2 日在首尔举行,由 vLLM KR 社区主办,并得到了 Rebellions、SqueezeBits、Red Hat APAC 和 PyTorch 韩国的大力支持。
摘要:预填充和解码任务竞争相同的 GPU,导致负载下 ITL(首字延迟)激增。我们展示了如何使用 AMD 的 MORI-IO 连接器在单个 8-GPU MI300X 节点上对它们进行解耦,从而实现 2.5 倍的性能提升...

随着 Gemma 4 的发布,vLLM 引入了对 Google 最复杂开放模型系列的支持,涵盖多个硬件后端,并首次在 Google TPU 上提供 Day 0 支持...

PR #33736(包含在 vllm>=v0.18.0 中)为 vLLM 引入了新的隐藏状态提取系统。本篇博客探讨了该功能的动机、设计、用法、未来方向及其...

我们很高兴地宣布推出 Model Runner V2 (MRV2),这是对 vLLM 模型运行器的从零重构。MRV2 带来了更简洁、更模块化、更高效的执行核心——且无需修改 API...

EAGLE 是目前大型语言模型 (LLM) 推理中投机采样领域最先进的方法,但其自回归草稿生成过程会产生一个隐蔽的瓶颈:生成的 Token 越多...

我们很高兴在 vLLM 上支持最新发布的 NVIDIA Nemotron 3 Super 模型。

自 v0.1 Iris 发布以来,vLLM Semantic Router 取得了巨大的飞跃。在同一个发布周期内,该项目重建了模型栈,将路由功能扩展到了安全性、语义缓存、内存、检索等领域……

本文改编自 Red Hat 主办的 vLLM 办公时间 (Office Hours) 会话,邀请了来自 IBM Research 的 Burkhard Ringlein,对 vLLM Triton Attention 后端进行了深入的技术讲解....

长期以来,启用 AMD 支持意味着“移植”,即仅仅让代码能运行。那个时代已经结束了。

对于运行多个自定义 AI 模型(尤其是近期的混合专家模型 MoE 系列)的企业和个人而言,当负载较低时,往往面临着为空闲 GPU 产能付费的挑战...

DeepSeek-V3.2 (NVFP4 + TP2) 已在 GB300 (SM103 - Blackwell Ultra) 上成功顺利运行。利用 FP4 量化,单 GPU 吞吐量达到了 7360 TGS (每 GPU 每秒 Token 数)...

继我们之前通过 wide-EP 实现 2.2k tok/s/H200 解码吞吐量的工作之后,vLLM 团队继续致力于针对 NVIDIA GB200 平台的性能优化。这篇博客...

摘要:通过与开源社区的合作,vLLM + NVIDIA 在运行于 NVIDIA Blackwell GPU 上的 gpt-oss-120b 模型上实现了显著的性能里程碑。通过深度...

大语言模型推理传统上基于一个简单的前提:用户提交一个完整的提示词(请求),模型进行处理,并返回一个响应(流式或以……方式)

我们正在致力于构建混合模型 (MoM) 的系统级智能,将集体智能引入 LLM 系统。

在本文中,我们将介绍 vLLM 0.11.0 中引入的全新 KV 缓存卸载功能。我们将重点讨论卸载到 CPU 内存(DRAM)及其对提高整体推理性能的好处...

vLLM Semantic Router 是混合模型 (MoM) 的系统级智能,将集体智能引入 LLM 系统。它位于用户和模型之间,从……中捕获信号

作为一名热情的 vLLM 社区成员,希望看到 vLLM 蓬勃发展并触及更多开发者,我很高兴宣布 vLLM Playground —— 一个功能丰富的现代 Web 界面,用于管理和……

长期以来,vllm.ai 只是直接跳转到 vLLM 的 GitHub 页面。感谢我们的社区,我们现在有了全新的 vllm.ai 网站,其设计灵感来自于 PyTorch 网站。

我们非常高兴地宣布 vLLM-Omni 的一次重大性能更新。

在 v0.11.0 中,vLLM V0 引擎的最后一部分代码被移除,标志着完全迁移到了改进后的 V1 引擎架构。这一成就离不开 vLLM 的...

在过去的几个月里,AMD 与 vLLM SR 团队展开合作,将 vLLM 语义路由 (VSR) 引入 AMD GPU——这不仅仅是一次性能优化,更是……

1月28日更新:NVIDIA 刚刚发布了 NVFP4 精度版本的 Nemotron 3 Nano 模型。该模型由 vLLM 直接支持,并使用了一种名为“量化感知蒸馏”的新方法...

现代大型多模态模型(LMMs)引入了一个独特的服务时瓶颈:在任何文本生成开始之前,所有图像都必须由视觉编码器(例如 ViT)进行处理。此编码器……

你的 LLM 调用了一个工具,接收到了准确的数据,但给出的答案仍然是错误的。欢迎来到外在幻觉的世界——模型自信地忽略了摆在眼前的基本事实...

- 投机采样是提升推理性能的一种优化手段;然而,为每个大语言模型训练一个独特的草稿模型既困难又耗时,而生产就绪的……

在模型副本集群中高效管理请求分配,是大规模生产环境部署 vLLM 的关键需求。标准的负载均衡器通常无法胜任,因为它们...

在不牺牲精度的前提下,实现更快、更高效的大模型服务!

几个月前,我们发布了一篇关于 CUDA Core Dump 的博客文章:调试内存访问问题及其他问题的有效工具,介绍了一种用于调试非法内存访问的强大技术……

我们很高兴宣布正式发布 vLLM-Omni,这是 vLLM 生态系统的一个重大扩展,旨在支持下一代 AI:全模态模型。

Ray 现在提供了一个新命令:ray symmetric-run。该命令允许在 Ray 集群的每个节点上启动相同的入口命令,简化了部署 vLLM 服务器的工作流...

来源:https://github.com/vllm-project/vllm-ascend

今天,我们很高兴地宣布 Docker 模型运行器现已集成 vLLM 推理引擎和 safetensors 模型,通过你熟悉的 Docker 工具即可解锁高吞吐量 AI 推理...

旧版本的 vLLM 语义路由依赖于基于分类的路由,这是一种直观的方法,即用户查询被分类到 14 个 MMLU 领域类别之一,然后...

介绍共享内存 IPC 缓存——由 Cohere 为 vLLM 项目贡献的高性能缓存机制。通过绕过冗余的进程间通信并保留大型...

Intel® Arc™ Pro B 系列 GPU 家族提供了强大的 AI 能力,并兼顾了易用性和出色的性价比。其大容量内存和可扩展性...

我们展示了一个开源的位运算一致性策略在线强化学习运行示例,使用 TorchTitan 作为训练引擎,vLLM 作为推理引擎。构建于 vLLM 最近在批处理不变性方面的工作之上...

我们很高兴发布由 vLLM 支持的 NVIDIA Nemotron Nano 2 VL。这款开源视觉语言模型 (VLM) 专为视频理解和文档智能而构建。

总结:为了与 vLLM 获得最佳兼容性,请使用聊天模板在 commit 94a4053eb8863059dd8afc00937f054e1365abbd (Kimi-K2-0905) 之后更新的 Kimi K2 模型,或者 commit……

语义路由系统面临着扩展性挑战。当每个分类请求都需要独立运行多个微调模型时,计算成本会随着模型数量线性增加...

多模型服务问题:你有两个 LLM,它们都能单独放入 GPU,但无法同时装下。传统的解决方案被迫在两者之间进行艰难的选择

具备推理、规划和自主行动能力的智能体 AI 系统,正在推动开发者应用的下一次飞跃。为了构建这些系统,开发者需要能够...

简单总结:智能体经常通过 OpenAI 兼容端点调用 LLM,这些端点以往只返回基于字符串的输入和输出。在智能体强化学习中,这可能导致训练与...

vLLM TPU 现在由 tpu-inference 提供支持,这是一个极具表现力和强大功能的新硬件插件,将 JAX 和 PyTorch 统一在单一的底层路径下。它不仅比上一代更快...

在过去的几个月里,我们一直与 NVIDIA 密切合作,旨在充分发挥其最新的 NVIDIA Blackwell GPU 架构 (B200/GB200) 在大语言模型上的潜力...

我们很高兴宣布 vLLM 即日起支持 DeepSeek-V3.2-Exp,该模型采用了为长上下文任务设计的 DeepSeek 稀疏注意力机制 (DSA)。在本文中,我们展示了如何使用该模型...

韩国首届 vLLM 聚会于 2025 年 8 月 19 日在首尔举行,由 Rebellions 和 Red Hat 主办,并得到了 PyTorch 韩国用户组和 SqueezeBits 的支持。

我们很高兴地宣布,vLLM 现在支持通义千问团队的最新一代基础模型 Qwen3-Next。Qwen3-Next 引入了一种混合架构,为以下任务提供了极致效率...

在过去的一年中,混合推理和自动路由日益成为大模型基础设施进步的定义——将辩论焦点从原始规模转移到单 Token 效率、延迟...

直到最近,生成式 AI 基础设施还与通常以自然语言形式逐个 Token 生成输出的自回归文本生成模型紧密耦合。vLLM...

当今大语言模型(LLM)的高速推理要求模型能够在不同的硬件、工作负载和规模上尽可能高效地执行。高效执行需要深度优化...

通用语言模型 (GLM) 是由智谱 AI (现更名为 Z.ai) 创建的基础模型系列。GLM 团队与 vLLM 团队有着长期的合作关系,可以追溯到……的早期

总结:如果遇到“非法内存访问”错误,可以启用 CUDA core dump 来调试该问题。只需设置以下环境变量并再次运行程序……

我们很高兴地宣布,vLLM 现已在 NVIDIA Blackwell 和 Hopper GPU,以及 AMD MI300x 和 MI355x GPU 上支持 gpt-oss。在这篇博客文章中,我们将探讨高效的模型...

本文探讨了 MiniMax-M1 的混合架构如何在 vLLM 中得到高效支持。我们讨论了该模型的独特功能、高效推理面临的挑战以及技术实现...

自 2024 年 12 月以来,通过 vLLM 社区和昇腾团队在 vLLM 上的共同努力,我们完成了硬件可插拔 RFC。该提案允许将硬件集成到 vLLM 中...

随着对训练具备推理能力的大语言模型(LLM)的需求增长,人类反馈强化学习(RLHF)已成为一项基石技术。然而,传统的 RLHF...

Hugging Face Transformers 库为庞大的模型架构生态系统提供了一个灵活、统一的接口。从研究到在自定义数据集上进行微调,Transformers 是首选...

我们很高兴宣布 vLLM 现已支持 Llama 4 模型系列:Scout (17B-16E) 和 Maverick (17B-128E)。您可以运行这些强大的长上下文、原生多模态(最高 8-10……

简单总结:AMD ROCm 上的 vLLM 现在拥有更好的 FP8 性能!

今天,我们很高兴发布 vllm-project/aibrix:由字节跳动开发、功能完备的 vLLM Kubernetes 服务栈。AIBrix 始于 2024 年初,已成功部署到……

服务大模型通常会导致内存瓶颈,例如可怕的 CUDA 内存不足错误。为了解决这个问题,主要有两种解决方案

我们很高兴地宣布,通过红帽 AI 工程团队与 Meta Llama Stack 团队的合作,vLLM 推理提供程序现已在 Llama Stack 中可用。这...

我们非常激动地宣布 vLLM V1 的 Alpha 版本发布,这是 vLLM 核心架构的一次重大升级。基于我们在过去一年半 vLLM 开发中学到的经验,我们重新审视了关键...
- vLLM 拥有最大的开源社区,但要将 vLLM 从最好的单节点 LLM 引擎转化为一流的 LLM 服务系统,需要做些什么? - 今天,我们发布了“vLLM...

- 结构化解码允许精确控制 LLM 的输出格式 - vLLM 现在同时支持 outlines 和 XGrammar 后端进行结构化解码 - 近期的 XGrammar 集成带来了高达 5 倍的性能提升...

LLM 推理领域正以前所未有的速度发展。随着新模型和新功能的每周涌现,传统的软件发布流水线往往难以跟上。在 vLLM,我们...

vLLM 社区在 2024 年取得了显著增长,从一个专业的推理引擎演变为开源 AI 生态系统的事实标准服务解决方案。这种转型是...

简单总结:vLLM 在 AMD MI300X 上释放了惊人的性能,在 Llama 3.1 405B 上实现了比 Text Generation Inference (TGI) 高 1.5 倍的吞吐量和 1.7 倍的首个 Token 时间 (TTFT)...

vLLM 中的投机采样是一种强大的技术,通过结合使用小型和大型模型来加速 Token 生成。在本博客中,我们将解析投机采样在...

简单总结:vLLM 在 Llama 8B 模型上实现了 2.7 倍的吞吐量提升和 5 倍的每个输出 Token 时间 (TPOT) 减少,在 Llama 70B 模型上实现了 1.8 倍的吞吐量提升和 2 倍的 TPOT 减少。

我们想与 vLLM 社区分享两个更新。

今天,vLLM 团队很高兴与 Meta 合作宣布支持 Llama 3.1 模型系列。Llama 3.1 带来了令人兴奋的新功能,包括更长的上下文长度(高达 128K...

- vLLM 在常见场景中与 DeepSpeed-FastGen 的速度持平,在处理较长输出时表现更优。 - DeepSpeed-FastGen 仅在提示词长而输出短的场景中表现优于 vLLM...

LLM 有望从根本上改变我们在所有行业中使用 AI 的方式。然而,实际部署这些模型具有挑战性,即使在昂贵的硬件上,运行速度也可能慢得令人惊讶。今天我们...