vLLM-Omni 发布:简便、快速且经济的全模态模型服务

4 分钟阅读
vLLM-Omni 团队

我们很高兴地宣布正式发布 vLLM-Omni,这是 vLLM 生态系统的一个重要扩展,旨在支持下一代 AI:全模态(Omni-modality)模型。

自诞生以来,vLLM 始终专注于大型语言模型(LLM)的高吞吐量、内存高效服务。然而,生成式 AI 的格局正在迅速变化。模型不再仅仅是“文本输入,文本输出”。当今最先进的模型能够跨文本、图像、音频和视频进行推理,并使用不同的架构生成异构输出。

vLLM-Omni 是首批支持全模态模型服务的开源框架之一,它将 vLLM 出色的性能扩展到了多模态和非自回归推理领域。

为什么选择 vLLM-Omni?

传统的服务引擎是针对基于文本的自回归(AR)任务进行优化的。随着模型演进为能够看、听和说的“全能(Omni)”智能体,服务基础设施也必须随之进化。

vLLM-Omni 解决了模型架构中的三个关键转变:

  1. 真正的全模态: 无缝处理和生成文本、图像、视频和音频。
  2. 超越自回归: 将 vLLM 高效的内存管理扩展到扩散模型(Diffusion Transformers, DiT)及其他并行生成模型。
  3. 异构模型流水线: 编排复杂的模型工作流,单个请求即可调用多个异构模型组件。(例如:多模态编码、AR 推理、基于扩散的多模态生成等)。

架构内幕

vLLM-Omni 不仅仅是一个封装器;它是对 vLLM 内部及外部数据流的重新构想。它引入了一个完全解耦的流水线,允许在生成的不同阶段进行动态资源分配。如上所示,该架构统一了不同的阶段:

  • 模态编码器: 高效编码多模态输入(ViT、Whisper 等)。
  • LLM 核心: 利用 vLLM 进行自回归文本和隐藏状态生成(支持一个或多个语言模型)。
  • 模态生成器: 为 DiT 和其他解码头提供高性能服务,以产生丰富的媒体输出。

关键功能

  • 简单性: 如果您会使用 vLLM,那么您就会使用 vLLM-Omni。我们保持与 Hugging Face 模型的无缝集成,并提供兼容 OpenAI 的 API 服务器。

  • 灵活性: 通过 OmniStage 抽象,我们提供了一种简单直接的方式来支持各种全模态模型,包括 Qwen-Omni、Qwen-Image 以及其他最先进的模型。

  • 性能: 我们利用流水线阶段执行来重叠计算,以实现高吞吐量性能,确保在某个阶段处理时,其他阶段不会处于闲置状态。

我们将 vLLM-Omni 与 Hugging Face Transformers 进行了基准测试,以展示其在全模态服务中的效率提升。

未来规划

vLLM-Omni 正在迅速演进。我们的路线图重点在于扩大模型支持范围,进一步突破高效推理的边界,并构建正确的框架来赋能未来关于全模态模型的研究。

  • 扩展模型支持: 我们计划随着开源全模态模型和扩散变换器的不断出现,支持更广泛的模型。
  • 自适应框架优化: 我们将持续改进框架,以支持新兴的全模态模型和执行模式,确保它仍然是生产工作负载和前沿研究的可靠基石。
  • 更深度的 vLLM 集成: 将核心全模态功能合并到上游,使多模态成为整个 vLLM 生态系统中的一等公民。
  • 扩散加速: 包括并行推理(DP/TP/SP/USP...)、缓存加速(TeaCache/DBCache...)和计算加速(量化/稀疏注意力...)。
  • 全面解耦: 基于 OmniStage 抽象,我们期望在不同的推理阶段支持完全解耦(编码器/预填充/解码/生成),以提高吞吐量并降低延迟。
  • 硬件支持: 遵循硬件插件系统,我们计划扩大对各种硬件后端的支持,以确保 vLLM-Omni 在任何地方都能高效运行。

入门指南

开始使用 vLLM-Omni 非常简单。最初的 vllm-omni v0.11.0rc 版本构建于 vLLM v0.11.0 之上。

安装

查看我们的安装文档了解详情。

服务于全模态模型

查看我们的示例目录,获取启动图像、音频和视频生成工作流的具体脚本。vLLM-Omni 还提供了 Gradio 支持以改善用户体验,下方是服务于 Qwen-Image 的演示示例。

加入社区

这仅仅是全模态服务的开始。我们正在积极开发对更多架构的支持,并诚邀社区共同塑造 vLLM-Omni 的未来。

让我们携手构建全模态服务的未来!