vLLM 2024 回顾与 2025 展望
vLLM 社区在 2024 年取得了显著增长,从一个专业的推理引擎演变为开源 AI 生态系统的事实标准推理解决方案。这种转型体现在我们的增长指标中:
- GitHub Star 数从 14,000 增长至 32,600(增长 2.3 倍)
- 贡献者人数从 190 增加至 740(增长 3.8 倍)
- 月下载量从 6,000 激增至 27,000(增长 4.5 倍)
- 过去六个月内 GPU 使用时长增加了约 10 倍
- 查看更多使用数据,请访问 https://2024.vllm.ai
vLLM 已确立其作为领先的开源 LLM 推理和服务引擎的地位,并被广泛应用于生产环境(例如为 Amazon Rufus 和 LinkedIn AI 功能提供动力)。我们的双月度聚会已成为与 IBM、AWS 和 NVIDIA 等行业领导者建立战略合作的重要平台,标志着我们正向成为开源 AI 生态系统的通用推理解决方案迈进。阅读下文了解更多关于 vLLM 2024 年的成就和 2025 年路线图!
本博客内容基于双周一次的 vLLM 办公时间 (Office Hours) 第 16 期整理。点击此处观看录像。
2024 年成就:模型扩展、硬件与功能升级
社区贡献与增长

2024 年对 vLLM 来说是极其非凡的一年!我们的贡献社区已大幅扩展,涵盖了:
- 来自 6 个以上组织的 15+ 位全职贡献者
- 20+ 个作为关键利益相关方和赞助商的活跃组织
- 来自加州大学伯克利分校、Neural Magic、Anyscale、Roblox、IBM、AMD、Intel 和 NVIDIA 等顶尖机构,以及全球个人开发者的贡献
- 一个连接模型创建者、硬件供应商和优化开发者的繁荣生态系统
- 促进透明度、社区增长和战略合作伙伴关系的常态化双周办公时间
这些数字不仅反映了增长,更体现了 vLLM 作为 AI 生态系统中关键基础设施的作用,支撑着从研究原型到服务数百万用户的生产系统的各类应用。
拓展模型支持

2024 年初,vLLM 仅支持少量模型。到了年底,该项目已演变为支持近 100 种模型架构:涵盖了几乎所有主流开源大语言模型 (LLM)、多模态(图像、音频、视频)、编码器-解码器、投机解码、分类、嵌入和奖励模型。值得注意的是,vLLM 引入了对状态空间模型 (State Space Models) 的生产级支持,探索了非 Transformer 语言模型的未来。
拓宽硬件兼容性

从最初仅支持 NVIDIA A100 GPU,vLLM 现已扩展至支持:
- NVIDIA GPU:针对 H100 进行了一流的优化,并支持从 V100 及更新版本的所有 NVIDIA GPU。
- AMD GPU:支持 MI200、MI300 和 Radeon RX 7900 系列,且在 MI300X 上的采用率正快速增长。
- Google TPU:支持 TPU v4、v5p、v5e 以及最新的 v6e。
- AWS Inferentia 和 Trainium:支持 trn1/inf2 实例。
- Intel Gaudi (HPU) 和 GPU (XPU):利用 Intel GPU 和 Gaudi 架构处理 AI 工作负载。
- CPU:支持多种指令集架构,包括 x86、ARM 和 PowerPC。
vLLM 的硬件兼容性已得到拓宽,以解决不同用户的需求并纳入性能改进。重要的是,vLLM 正在确保所有模型都能在所有硬件平台上运行,并启用所有相关优化。
交付关键功能

vLLM 的 2024 年开发路线图强调了性能、可扩展性和易用性:
- 权重与激活量化:增加了对多种量化方法和算子的支持,实现了跨硬件平台的有效推理。显著的集成包括 FP8+INT8 激活量化、用于 GPTQ/AWQ/wNa16 的 Marlin+Machete 算子、FP8 KV 缓存、AQLM、QQQ、HQQ、bitsandbytes 和 GGUF。目前超过 20% 的 vLLM 部署使用了量化。
- 自动前缀缓存 (Automatic Prefix Caching):降低了重上下文应用的成本并提升了延迟表现。
- 分块预填充 (Chunked Prefill):提升了交互式应用中首字延迟的稳定性。
- 投机解码 (Speculative Decoding):通过同时进行 token 预测和验证来加速生成,支持草稿模型、提示词中的 n-gram 匹配以及 Medusa 或 EAGLE 等 MLP 推测器。
- 结构化输出 (Structured Outputs):为需要 JSON 或 pydantic 模式等特定格式的应用提供了高性能能力。
- 工具调用 (Tool Calling):使支持聊天模板的模型能够自主生成工具调用,促进了数据处理和智能体流程。
- 分布式推理 (Distributed Inference):引入了流水线并行和拆分预填充 (disaggregated prefill),以有效地跨 GPU 和节点扩展工作负载。
我们的 2025 年愿景
在 2025 年,我们预计在预训练和推理时的扩展方面将有重大突破。我们相信开源模型正迅速赶上专有模型,通过蒸馏,这些庞大的模型正变得更小、更智能,且更适合生产部署。
新兴模型能力:在单节点上运行 GPT-4o 级别模型
我们的愿景宏大而具体:在单个 GPU 上实现 GPT-4o 级别的性能,在单个节点上实现 GPT-4o 的性能,并在小型集群上实现下一代扩展能力。为实现这一目标,我们正专注于三个关键的优化前沿:
-
利用滑动窗口、跨层注意力机制和原生量化来优化 KV 缓存和注意力机制
-
针对具有共享专家和大量细粒度专家架构的 MoE 进行优化
-
通过状态空间模型等替代架构扩展对长上下文的支持
除了原始性能,我们还在为特定的垂直应用量身定制 vLLM。每个用例都需要特定的优化:推理应用需要自定义 token 和灵活的推理步骤;代码编写需要“中间填充”能力和提示词查找解码;智能体框架受益于基于树的缓存;创意应用则需要多样化的采样策略,包括束搜索变体和对比解码。
我们还在扩展 vLLM 在模型训练过程中的角色。最近 John Schulman 等著名研究人员的采用,标志着我们在训练后工作流中重要性的提升。我们将提供与数据整理和训练后流程的紧密集成,使 vLLM 成为整个 AI 开发生命周期中必不可少的工具。
实践规模化:为数千个生产集群提供动力
随着 LLM 成为现代应用的主干,我们设想 vLLM 将驱动数千个 24/7 运行的生产集群。这些不是实验性部署,而是由专门的平台团队维护、处理产品功能持续流量的使命关键系统。
为支持这种规模,我们正使 vLLM 真正成为生产应用的“一站式”解决方案。量化、前缀缓存和投机解码将成为默认功能而非可选优化。结构化输出生成将成为标配。我们正在开发用于路由、缓存和自动扩展的综合方案,覆盖生产部署的整个生命周期。
随着部署规模超越单个副本,我们正在为集群级解决方案创建稳定的接口。这包括针对流行模型和硬件平台调整的健壮默认配置,以及针对不同用例的灵活优化路径。我们正在培养一个致力于推动 vLLM 效率极限的社区,确保我们的平台不断进化以应对新的挑战。
开放架构:我们未来的基石
vLLM 持续成功的关键在于其开放架构。我们将在 V1 版本中发布从底层重构的代码,这也体现了这一哲学。每一个组件——从模型架构到调度策略、内存管理到采样策略——都旨在进行修改和扩展,无论是用于研究还是私有分支。
我们对开放的承诺不仅限于代码。我们正在引入:
-
可插拔架构,用于无缝集成新模型、硬件后端和自定义扩展
-
一流的
torch.compile支持,实现自定义算子融合和快速实验 -
灵活的组件系统,在保持核心稳定性的同时支持私有扩展
我们将加倍投入社区发展,在跨组织协调工程工作的同时赞美生态系统项目。这包括通过明确的招聘流程和组织结构壮大我们的核心团队。目标不仅仅是让 vLLM 在技术上成为最佳选择,更是要确保每一位投入 vLLM 的人都能从中获益。
我们的架构不仅仅是一个技术选择,更是通过可扩展性和修改性(而非锁定)来创建一个互联生态系统的承诺。通过使 vLLM 既强大又可定制,我们确保了它在 AI 推理生态系统核心的地位。
反思与回顾
回顾 vLLM 的旅程,一些塑造了我们增长并继续指引我们前行的关键主题浮现出来。
构建 AI 生态系统的桥梁
最初的推理引擎已经演变为更重要的存在:一个架起 AI 领域内此前孤立世界的平台。模型创建者、硬件供应商和优化专家都在 vLLM 中找到了对其贡献的独特放大器。当硬件团队开发新的加速器时,vLLM 提供了通往广泛应用生态系统的即时通路。当研究人员设计出创新的优化技术时,vLLM 提供了一个生产就绪的平台来展示现实世界的影响力。这种贡献与放大的良性循环已成为我们身份的核心,推动我们不断提升平台的可访问性和可扩展性。
在保持卓越的同时管理增长
2024 年的指数级增长既带来了机遇也带来了挑战。代码库和贡献者群体的迅速扩张带来了前所未有的速度,使我们能够应对雄心勃勃的技术挑战并快速响应社区需求。然而,这种增长也增加了代码库的复杂性。我们没有让技术债务积累,而是决定投资于我们的基础。2024 年下半年,我们对 vLLM 的核心架构进行了雄心勃勃的重新设计,最终形成了我们现在所说的 V1 架构。这不仅仅是一次技术更新——这是一项深思熟虑的举措,旨在确保我们的平台在扩展以满足不断扩大的 AI 生态系统需求时,保持可维护性和模块化。
开创开源开发新模式
或许我们最独特的挑战是通过一个由受赞助的志愿者组成的网络来构建一个世界级的工程组织。与依赖单一组织资助的传统开源项目不同,vLLM 正在走一条不同的道路。我们正在创造一个协作环境,多个组织不仅贡献代码,还贡献资源和战略方向。这种模式带来了协调、规划和执行方面的新挑战,但也为创新和韧性提供了前所未有的机会。我们正在学习——有时是发明——从分布式决策到跨组织远程协作等各个方面的最佳实践。
我们坚定不移的承诺
经历了所有这些变化和挑战,我们的基本使命依然清晰:构建世界上最快、最易用的开源 LLM 推理和服务引擎。我们相信,通过降低高效 AI 推理的门槛,我们可以使高级 AI 应用对每个人来说都更实用、更易于访问。这不仅仅是关于技术卓越——这是关于建立一个让整个 AI 社区能够共同更快前进的基础。
使用数据收集
本篇博客中的指标和洞察力由 vLLM 的 使用统计系统 提供支持,该系统收集匿名部署数据。每个 vLLM 实例都会生成一个 UUID 并报告技术指标,包括:
- 硬件规格(GPU 数量/类型、CPU 架构、可用内存)
- 模型配置(架构、数据类型、张量并行度)
- 运行时设置(量化类型、是否启用前缀缓存)
- 部署环境(云供应商、平台、vLLM 版本)
这些遥测数据有助于确定常见硬件配置的优化优先级,并识别哪些功能需要改进性能。数据在本地存储于 ~/.config/vllm/usage_stats.json。用户可以通过设置 VLLM_NO_USAGE_STATS=1、DO_NOT_TRACK=1 或创建 ~/.config/vllm/do_not_track 来选择退出。实施细节和完整架构可在我们的 使用统计文档 中找到。
加入这段旅程
vLLM 的 2024 年历程展示了开源协作的变革潜力。有了 2025 年的清晰愿景,该项目已准备好重新定义 AI 推理,使其更易于访问、更具可扩展性和效率。无论是通过代码贡献、参加 vLLM 办公时间,还是在生产环境中使用 vLLM,每一位参与者都在塑造这个快速发展项目的未来。
步入 2025 年,我们继续鼓励通过以下方式参与社区:
- 贡献代码:帮助完善 vLLM 的核心功能或扩展其能力——许多 RFC 和功能都需要额外的支持
- 提供反馈:通过 GitHub、Slack、Discord 或各类活动分享对功能和用例的见解,以塑造 vLLM 的路线图
- 使用 vLLM 进行构建:在您的项目中采用该平台,发展您的专业知识并分享您的经验
加入 vLLM 开发者 Slack,从项目负责人那里获得指导,并在 AI 推理创新的前沿工作。
让我们在 2025 年共同推进开源 AI 创新!