韩国首届 vLLM 聚会

韩国首届 vLLM 聚会于 2025 年 8 月 19 日在首尔举行,由 Rebellions 和 Red Hat 主办,并得到了 PyTorch 韩国用户组和 SqueezeBits 的支持。
关键数据:共有 350 多人报名,参会者来自 75 多家公司,其中 80% 为行业专业人士,而在这些专业人士中,80% 是软件工程师和研究人员。这是 vLLM 在韩国的首次亮相,反响极其热烈。
本次活动汇聚了当地的开发者、研究人员和 AI 基础设施工程师,共同探讨高效 LLM 推理的见解,并探索 vLLM 如何实现可扩展、硬件友好的部署——现在已涵盖 NPU。
精彩回顾
vLLM + llm-d 简介及 vLLM TPU 集成深度解析(主讲:Nicolo Lucchesi)

Red Hat 高级机器学习工程师 Nicolò Lucchesi 在开场中强调了 vLLM 背后的核心创新——通过创新的分页注意力(PagedAttention)架构解决了 KV 缓存和动态批处理中长期存在的挑战。他强调,“现代问题需要传统的解决方案”,并指出调度和内存管理方面的确切挑战已经在操作系统中得到解决,而 vLLM 只是将这些经过验证的理念应用于 AI 推理。
他还介绍了 llm-d,这是一个支持分布式推理的项目。llm-d 是一个 Kubernetes 原生的编排层,用于协调多个 vLLM 实例并支持自动缩放——可谓是“vLLM 与 Kubernetes 的相遇”。
Nicolò 最后介绍了目前正在进行的将 Google TPU 等 AI 加速器集成到 vLLM 中的工作,以进一步提升 vLLM 在不同硬件平台上的可用性。
构建、测试并向 vLLM 贡献代码(主讲:Daniele Trifirò)

Red Hat 高级软件工程师 Daniele Trifirò 分享了开发者如何构建、测试并为 vLLM 项目做出贡献,重点关注现实世界中的 AI 服务。他强调了快节奏的开发周期,每周发布和不断增长的贡献者群体正在推动代码库的巨大变革。由于硬件需求,构建 vLLM 并不总是简单的,Daniele 提供了实用的建议和见解,帮助新贡献者快速上手。
他还解释了硬件特定编译的必要性,指出构建时的内存使用量会根据目标(如 CUDA、ROCM、TPU)急剧波动。为了提高灵活性和开发者接入能力,他介绍了 vLLM 新的硬件插件系统。这种插件架构使得 vLLM 更加独立于设备,进一步巩固了其作为强大且可扩展的 AI 服务生态系统的地位。
利用 vLLM 为 Rebellions NPU 注入动力(主讲:金洪锡)

Rebellions 首席软件架构师金洪锡谈到了 vLLM 对 AI 加速器初创公司日益增长的重要性,并分享了 Rebellions 如何为更广泛的 AI 推理服务生态系统做出贡献。他强调,vLLM 的硬件插件系统使像 Rebellions 这样的公司能够支持开发者在定制硬件上部署 LLM,提供近乎无缝的体验,效果堪比在 GPU 上运行。
得益于 vLLM,工程师现在可以直接在 Rebellions 的 NPU 上运行 MoE(混合专家)模型,同时利用并行处理和连续批处理等核心优化——且无需复杂的集成步骤。这为在下一代加速器上实现高效、可扩展的 AI 服务打开了大门。
使用 vLLM 进行量化与评估(主讲:金亨俊)

来自 SqueezeBits 的金亨俊探讨了量化如何成为 LLM 部署的重要组成部分,以及如何在 vLLM 生态系统中有效使用量化。他概述了使用 vLLM 服务量化模型的两种主要方式:加载预量化模型进行服务,或自行量化模型后再部署。
为了简化这一过程,vLLM 项目包含了一个名为 LLM Compressor 的开源子项目,帮助开发者更轻松地将量化集成到工作流中。金亨俊还介绍了 SqueezeBits 的开源工具包 Fits on Chips,该工具包用于评估 vLLM 中的 LLM 服务性能。该工具包有助于比较吞吐量、延迟、准确性和硬件,清晰地展示最高效的服务配置。
展望未来

本次聚会还展望了 vLLM 韩国社区的未来增长。我们计划与当地工程团体合作,定期举办 vLLM 韩国聚会,包括 PyTorch 韩国用户组和 Python 韩国。这些聚会将包括实践研讨会、开发者交流会和小组会议,旨在加强社区联系并推动对 vLLM 生态系统的技术贡献。
在开源的早期,贡献分配得比较均匀。但随着 LLM 的兴起和对 AI 加速器需求的增加,个人工程师和学者获得实际经验变得更加困难。我们相信,通过社区驱动的基础设施和协作,我们可以建立一个可持续的实践学习环境——我们欢迎新的志愿者加入,共同塑造 vLLM 的未来。

这次首届聚会标志着韩国 vLLM 社区迈出了令人兴奋的一步,重申了最重要的一点:为现实世界的 AI 服务提供实用、可扩展的解决方案。Rebellions、Red Hat 以及该地区充满热情的工程师们致力于支持更多社区驱动的活动,并持续为 vLLM 项目做出贡献。
感谢所有参加并使首次聚会取得成功的朋友——我们才刚刚开始。