vLLM 的开放治理与性能路线图

阅读需 4 分钟
vLLM 团队

我们想与 vLLM 社区分享两个更新。

vLLM 的未来是开放的

我们很高兴看到 vLLM 正在成为大语言模型(LLM)推理和服务的事实标准。在最近发布的 Meta Llama 3.1 公告中,10 家实时推理官方合作伙伴中有 8 家使用 vLLM 作为 Llama 3.1 模型的服务引擎。我们也从多方了解到,vLLM 正被应用于我们日常生活中许多 AI 功能的后端。

我们相信 vLLM 的成功源于强大的开源社区力量。vLLM 由加州大学伯克利分校、Anyscale、AWS、CentML、Databricks、IBM、Neural Magic、Roblox、Snowflake 等机构和组织组成的联盟积极维护。为此,我们希望确保该项目的所有权和治理也是开放且透明的。

我们激动地宣布,vLLM 已 启动了加入 LF AI & Data 基金会的孵化流程。这意味着没有任何单一实体能够垄断 vLLM 的未来。其许可协议和商标将永久保持开放。您可以确信 vLLM 将长期存在,并将在未来得到积极的维护与改进。

性能是重中之重

vLLM 的贡献者们正全力以赴,确保 vLLM 成为最快、最易用的 LLM 推理和服务引擎。

回顾我们的路线图,vLLM 专注于六大目标:广泛的模型覆盖、通用的硬件支持、顶级的性能、生产就绪、繁荣的开源社区以及可扩展的架构。

在性能优化方面,我们迄今已取得以下进展:

  • 基准测试发布
    • 我们在 perf.vllm.ai 上发布了基于每次代码提交(per-commit)的性能跟踪器,旨在监控性能增强和回归问题。
    • 发布了 vLLM 与 LMDeploy、TGI 和 TensorRT-LLM 对比的可复现基准测试(文档)。其目的是找出性能差距并加以弥补。
  • 高度优化算子的开发与集成
    • 将 FlashAttention2 与 PagedAttention 以及 FlashInfer 进行了集成。我们计划集成 FlashAttention3
    • 集成 Flux,以实现计算与集体通信的重叠。
    • 为量化推理开发了最先进的算子,包括 INT8 和 FP8 激活量化(通过 cutlass),以及针对 GPTQ 和 AWQ 的 INT4、INT8 和 FP8 权重仅量化(通过 marlin)。
  • 启动了多项旨在降低关键开销的工作流
    • 我们发现 vLLM 同步且阻塞式的调度器是在快速 GPU(如 H100)上运行模型时的主要瓶颈。我们正在致力于使其调度实现异步化,并计划提前进行任务规划。
    • 我们发现 vLLM 的 OpenAI 兼容 API 前端存在高于预期的开销。我们正致力于将其与调度器和模型推理的关键路径隔离开来。
    • 我们发现 vLLM 的输入准备和输出处理在数据规模增加时扩展性不佳。许多操作可以通过向量化处理,或通过移出关键路径来进行优化。

我们将持续向社区更新 vLLM 在弥补性能差距方面的进展。您可以在此处跟踪我们的总体进度。请继续提出新想法并贡献您的改进!

更多资源

我们希望强调以下正在积极开发中的重要特性(RPCs):

有一个繁荣的研究社区正基于 vLLM 构建他们的研究项目。我们对这些出色的工作深感敬佩,并期待开展合作与集成。论文列表包括但不限于: