vLLM 快速高效的 LLM 推理:DeepLearning.AI 新课程发布

5 分钟阅读
Cedric Clyburn

我们很高兴地宣布,与红帽(Red Hat)及 吴恩达(Andrew Ng) 创办的 DeepLearning.AI 合作,推出了一门实践性课程。该课程涵盖了 LLM 基础知识,以及使用 vLLM 及其生态工具进行 AI 部署的全生命周期,包括优化、部署和基准测试。课程名称为 使用 vLLM 进行快速高效的 LLM 推理(Fast & Efficient LLM Inference with vLLM),现已上线!

“对于许多用户而言,以低延迟、合理的成本高效部署开源 LLM 是一项挑战。本课程将向你展示实现方法。” —— 吴恩达

课程是如何诞生的

今年早些时候,我们与 DeepLearning.AI 团队沟通,希望构建一门专注于 LLM 推理优化的课程。鉴于 vLLM 生态系统已不仅包含推理引擎本身,还涵盖了模型压缩工具(LLM Compressor)和部署基准测试工具(GuideLLM),我们看到了展示如何在模型大规模部署时将这些组件整合起来的机会。

我们与吴恩达及其团队在山景城密切合作,围绕许多部署所遵循的工作流程设计了课程材料:压缩模型以适配硬件,使用 vLLM 高效服务,然后进行基准测试以理解速度、成本与准确性之间的权衡。在代码示例开始之前,课程还包含了大量关于推理和内存的基础概念,这能真正帮助学习者理解为何诸如连续批处理(continuous batching)、PagedAttention 和前缀缓存(prefix caching)等优化手段如此有效。


本课程在进入动手实验室之前,涵盖了硬件需求、内存层次结构和优化技术。

我们投入了什么

我们将大量精力投入到了可视化上。我们希望学习者能真正理解推理背后发生了什么,以及 KV Cache(键值缓存)和 GPU 内存层次结构。

我们拆解了推理时的 Transformer 架构,例如 tokens 如何在模型中流动,每一层发生了什么计算,以及瓶颈实际存在于何处。我们还对 KV Cache 进行了可视化:它在 GPU 内存中是什么样子,随着每个 token 的生成它是如何增长的,以及为什么服务于多个并发用户会产生巨大的内存压力。


在课程中可视化 KV Cache 在自回归生成过程中的增长情况。

针对量化,我们构建了可视化解释,展示当模型从默认发布的 FP16 权重转换为 INT8 或 INT4 时会发生什么,包括其带来的好处和代价。


解析纯权重量化(weight-only)与权重和激活值量化(weight-and-activation)的区别,以及 GPU 内存层次结构。

课程内容

课程主要分为三个阶段,每个阶段都有一个在 JupyterLab 环境中的动手实验,学习者可以在其中使用实际模型和运行中的 vLLM 服务器进行操作。

压缩

你将使用 LLM Compressor 对全精度 Qwen 模型进行量化。你将比较量化前后的模型大小,然后测量困惑度(perplexity)来量化准确性的权衡。这个实验让你对量化技术以及如何减少部署 LLM 时的 GPU 内存需求有深刻体会。


在课程实验中使用 LLM Compressor 量化 Qwen 模型。

服务

你将学习如何使用 vLLM 部署模型,并通过兼容 OpenAI 的 API 与其交互。你将通过 vLLM 的指标观察连续批处理等机制,查看随着并发请求的增加,内存使用率如何变化,以及前缀缓存如何在请求共享系统提示(system prompt)时避免冗余计算。


在并发请求涌向服务器时,实时观察 vLLM 的服务指标。

基准测试

你将使用 GuideLLM 模拟真实的流量模式,测量负载下的延迟和吞吐量。然后,你将使用 lm-eval 评估模型质量,以确认压缩后的模型是否仍满足你的准确性要求。课程结束时,你将完成对真实模型的完整负载/准确性分析,并能充分理解权衡取舍,从而做出明智的部署决策。


在课程实验中运行 GuideLLM,在模拟流量下对 vLLM 部署进行基准测试。

课程详情

该课程在 DeepLearning.AI 上免费提供。如果你一直在本地或大规模运行模型,并希望了解底层机制,或者听说过 vLLM 并想动手尝试,这门课程将非常有用!你将获得部署开源模型的经验,我们希望这是一个有用的资源。

致谢

这门课程是团队努力的结晶。来自红帽的 Saša Zelenović、Michael Goin 和 Sawyer Bowerman 为课程设计、技术内容和实验开发做出了贡献。来自 DeepLearning.AI 的 Hawraa Salami 帮助塑造了课程大纲和制作流程。感谢吴恩达的合作,并为 DeepLearning.AI 产品目录中开源推理工具留出了空间。希望你喜欢这门课程!