介绍 AIBrix:vLLM 的可扩展、高性价比控制平面

4 分钟阅读
AIBrix 团队

今天,我们很高兴发布 vllm-project/aibrix:一个由字节跳动开发、功能完备的 vLLM Kubernetes 服务栈。AIBrix 始于 2024 年初,已在字节跳动内部成功部署并支持了多种业务场景,证明了其在大规模部署中的可扩展性和有效性。

虽然 vLLM 使部署单个服务实例变得简单,但大规模部署 vLLM 在路由、自动扩缩容和容错方面面临着独特的挑战。AIBrix 是一个开源项目,旨在为构建可扩展的推理基础设施提供必要的构建模块。它提供了一种云原生解决方案,专门针对企业需求,优化了大型语言模型(LLM)推理的部署、管理和扩缩容。

初始版本重点关注以下关键功能:

  • 高密度 LoRA 管理:简化对轻量级、低秩模型自适应(LoRA)的支持。
  • LLM 网关与路由:高效管理和调度跨多个模型和副本的流量。
  • LLM 应用定制化自动扩缩容:根据实时需求动态扩展推理资源。
  • 统一 AI 运行时:一个通用的 Sidecar,支持指标标准化、模型下载和统一管理。
  • 分布式推理:支持跨多个节点处理大规模工作负载的可扩展架构。
  • 分布式 KV 缓存:实现高容量、跨引擎的 KV 复用。
  • 高性价比的异构服务:在满足服务等级目标(SLO)的前提下,实现混合 GPU 推理以降低成本。
  • GPU 硬件故障检测:主动检测 GPU 硬件问题。

AIBrix 愿景与行业合作

AIBrix 建立在系统与推理引擎协同设计的原则之上,核心目标是以云原生方式在 Kubernetes 上构建可扩展的推理系统。展望未来,我们将通过以下举措继续探索协同设计方法:

  • 扩展分布式 KV 缓存,以支持更广泛的场景,包括预填充与解码(P&D)聚合、请求迁移和跨实例 KV 复用,从而提高内存效率和推理灵活性。
  • 将 QoS、优先级、公平性等传统的资源管理原则应用于 LLM 推理,以实现请求级的多租户,确保高效的资源分配。
  • 应用基于 Roofline 模型的分析来优化计算效率,并在各种工作负载下提供强大的 SLO 保障的推理性能。

作为使命的一部分,我们积极与行业领袖合作,共同推动 LLM 服务领域开放、云原生的解决方案。

“字节跳动一直是一位杰出的合作伙伴,通过服务工作组(Working Group Serving)协助 Google 推动 Kubernetes 中 LLM 服务的标准化,并为网关 API 推理扩展(Gateway API Inference Extension)做出了贡献。我们很高兴能继续在共享组件上进行合作,这将赋能 AIBrix 和大规模推理平台。” - Clayton Coleman,Google Kubernetes Engine (GKE) 杰出工程师及推理负责人

“vLLM 在全球范围内取得了爆发式增长,已成为 LLM 推理的基石。AIBrix 是一个充满希望的项目,它基于这种增长势头,为 vLLM 的生产化提供了强大的能力,同时也推动了开源 LLM 推理的创新。” - Robert Nishihara,Anyscale 联合创始人、Ray 共同创建者

探索更多

欢迎访问仓库 https://github.com/vllm-project/aibrix,并查阅我们的博客文章,深入了解 AIBrix 的架构和关键功能。如需更深入的理解,请查看我们关于设计理念和成果的白皮书;按照文档进行部署和集成,并加入 vLLM Slack 的 aibrix 频道与开发者交流。

常见问题解答

AIBrix 与 vLLM 的 生产栈 (production stack) 有何不同?

  • AIBrix 是字节跳动发布的开源项目,侧重于大规模用例和云原生解决方案。由芝加哥大学 LMCache 团队管理的生产栈是一个开放框架,欢迎所有人进行扩展、实验和贡献。您可以在此处查看生产栈的路线图。

  • AIBrix 是一个功能强大的 K8s 栈示例,并且已经在生产环境中运行了 6 个多月。生产栈则是一个从零开始的实现,专注于通过社区的反馈和贡献来迭代每一个构建模块。

  • 生产栈的预期优势在于利用内置的 KV 缓存优化(传输、混合、路由),这在长上下文和重预填充工作负载中尤为有利。短期内,生产栈计划利用 AIBrix 中的组件。

AIBrix 是社区驱动的项目吗?

当然是。在 vLLM 项目组织下开源的目的是为了开放合作,欢迎从业者和研究人员共同参与。目前已规划了许多增强领域,核心开发者们坚信:开源是未来!

AIBrix 与 KServe、KubeAI 等其他云原生解决方案有何不同?

AIBrix 提供了与 vLLM 更原生的集成。通过仅针对推理引擎进行设计,AIBrix 能够优先处理诸如快速模型加载、自动扩缩容和 LoRA 管理等功能。