使用 vLLM production-stack 在 K8s 中实现高性能且易于部署的 vLLM 服务
总结
- vLLM 拥有最大的开源社区,但要将 vLLM 从最优秀的单节点 LLM 引擎转变为一流的 LLM 服务系统,还需要做些什么?
- 今天,我们发布了“vLLM production-stack”,这是一个基于 vLLM 的完整推理栈,带来了两大核心优势:
- 性能提升 10 倍(响应延迟降低 3-10 倍,吞吐量提高 2-5 倍),通过前缀感知请求路由和 KV-cache 共享实现。
- 集群部署轻松,内置容错、自动缩放和可观测性支持。
- 最棒的是?它是开源的——每个人都可以立即上手! [https://github.com/vllm-project/production-stack]
背景
在人工智能的军备竞赛中,比拼的不再仅仅是谁拥有最好的模型,而是谁拥有最好的 LLM 服务系统。
vLLM 席卷了开源社区,凭借无与伦比的硬件和模型支持,以及活跃的顶级贡献者生态系统脱颖而出。但到目前为止,vLLM 主要集中在单节点部署上。
我们如何将其能力扩展为一个全栈推理系统,让任何组织都能以高可靠性、高吞吐量和低延迟进行大规模部署?这正是 LMCache 团队与 vLLM 团队共同构建 vLLM production-stack 的原因。
介绍“vLLM Production-Stack”
vLLM Production-stack 是一个基于 vLLM 构建的开源推理栈参考实现,旨在无缝运行在 GPU 节点集群上。它增加了四项关键功能,补充了 vLLM 的原生优势:
- KV cache 共享与存储:在重用上下文时加速推理(由 LMCache 项目提供支持)。
- 前缀感知路由:将查询发送到已持有相关上下文 KV cache 的 vLLM 实例。
- 可观测性:监控单个引擎状态和查询级指标(TTFT、TBT、吞吐量)。
- 自动缩放:处理动态工作负载。
与替代方案的对比
以下是 vLLM production-stack 与其同类产品的快速对比概览:
架构设计
vLLM production-stack 架构构建在 vLLM 强大的单节点引擎之上,提供集群范围的解决方案。
概括来说:
- 应用程序发送 LLM 推理请求。
- 前缀感知路由会检查请求的上下文是否已缓存在某个实例的内存池中,然后将请求转发到拥有预计算缓存的节点。
- 自动缩放和集群管理器监控整体负载,并在需要时启动新的 vLLM 节点。
- 可观测性模块收集 TTFT(首字延迟)、TBT(字间延迟)和吞吐量等指标,为您提供系统健康状况的实时洞察。
优势 #1:轻松部署
使用 Helm Chart,只需运行一条命令即可将 vLLM production-stack 部署到您的 K8s 集群中。
sudo helm repo add llmstack-repo https://lmcache.github.io/helm/ &&\
sudo helm install llmstack llmstack-repo/vllm-stack
有关详细信息,请参阅 vLLM production-stack 仓库 中的详细 README。同时还提供了关于设置 K8s 集群和自定义 Helm Chart 的 教程。
优势 #2:性能提升
我们在 vLLM production-stack 和其他方案(包括 vLLM + KServe 和商业端点服务)上进行了多轮问答工作负载的基准测试。结果显示,vLLM 栈在关键指标(首字延迟和字间延迟)上均优于其他设置。
优势 #3:轻松监控
通过延迟分布、随时间变化的请求数、KV cache 命中率等关键指标,实时跟踪您的 LLM 推理集群。
总结
我们很高兴发布 vLLM Production Stack——这是将 vLLM 从一流单节点引擎转型为全规模 LLM 服务系统的下一步。我们相信,vLLM 栈将为那些希望在不牺牲性能或简单性的前提下,大规模构建、测试和部署 LLM 应用程序的组织打开新的大门。
如果您和我们一样感到兴奋,那就别再等待了!
- 克隆仓库:https://github.com/vllm-project/production-stack
- 快去试用吧
- 欢迎分享您的想法!
- 兴趣表
加入我们,共同构建一个让每个应用程序都能轻松利用 LLM 推理力量的未来——可靠、可扩展且无需费力。部署愉快!
联系我们