vLLM 韩国聚会 2026 总结

阅读需 7 分钟
vLLM 团队

vLLM 韩国聚会 2026 于 4 月 2 日在首尔举行,由 vLLM KR 社区主办,并得到了 Rebellions、SqueezeBits、Red Hat APAC 和 PyTorch 韩国的大力支持。

本次 Meetup 的意义远超一场普通的科技活动。不仅当天到场人数众多,会后调查的响应率也高达约 75%——这充分证明了与会者的高度参与热情。调查结果显示整体满意度极高,确认了本次 Meetup 既提供了深入的实践内容,也带来了纯粹的社区体验。

来自众多公司和研究机构的现场工程师齐聚一堂,分享了在生产环境中运行 LLM 的真实部署案例和基础设施策略。随着 AI 从研究阶段迈向全面服务化,高效处理推理工作负载已成为核心挑战。在此背景下,vLLM 正迅速成为高性能 LLM 服务的基础设施标准,其应用场景已从云端扩展至企业内部。

前言:vLLM 生态系统的扩展与标准化


Meetup 开场由来自 Rebellions 的 Hongseok Kim 博士和红帽(Red Hat)亚太区的 Li Ming 带来了最新的 vLLM 项目进展和社区动态。

Kim 博士介绍了 vLLM KR 社区自成立以来六个月里构建的运营结构——一种以指导小组(Steering Group)为中心的治理模型,辅以定期的 Meetup 和动手实操工坊。在技术层面,他重点介绍了 vLLM 从 v0 到 v1 的架构重构,这简化了代码库并增强了模块化。除了内部结构性改进(如异步调度和 Model Runner 优化)外,特性扩展也十分迅速:包括流式 API、语义路由和 vLLM-Omni。


Li Ming 介绍了旨在降低 vLLM 入门门槛(拥有 140 多个配置参数)的 vllm-playground。该基于图形界面的工具缩短了初次运行时间,支持 CPU 和 macOS 环境,并包含性能可视化功能——使得各团队能够更轻松地进行实验并采用 vLLM。

本次会议传递的信息非常明确:LLM 服务不再仅仅是选择框架的问题,它已演变成一个基础设施挑战——需要在差异巨大的环境中实现高效运行。

将 AI 加速器与 vLLM 集成

Kim 博士还探讨了 vLLM 与 AI 加速器硬件的集成路线图。AI 半导体公司 Rebellions 正在开发 vllm-rbln 插件,将其专有的 NPU 引入 vLLM 生态系统。PagedAttention 和 Continuous Batching 等核心功能已在 NPU 环境中实现并得到支持。更先进的功能(包括投机采样、分布式 KV 缓存以及 Prefill/Decode 解耦)目前正在开发中,新一代 NPU 如 Rebel100™ 正在为大规模推理集群部署铺平道路。

这种方案反映了行业的宏观转型:AI 推理基础设施正围绕 vLLM 作为连接不同加速器的公共层进行重构,而非依赖于硬件特定的孤岛式优化。

vLLM 生产堆栈:现状与未来


在第三个议题中,SqueezeBits 的 CTO Taesoo Kim 介绍了 vLLM 生产堆栈——涵盖了它在实际运营环境中的现有能力、演进过程以及未来方向。

核心主题是:vLLM 的成长已远超简单的模型推理服务,它正稳步获得生产环境所真正需要的运营特性和可扩展性。

双轨制:开源与商业

从中段开始,Meetup 分为两条并行轨道,以适应更多元化的现实视角。与会者可以选择 Track 1(开源 vLLM)或 Track 2(商业中的 vLLM),每个轨道包含两个议题。


Track 1 — 议题 1:内存与缓存作为 LLM 服务优化的核心

来自 XCENA 的 Juho Lee 展示了关于 vLLM 生产堆栈和 KV 缓存优化策略的分享。XCENA 是一家专注于内存计算的初创公司,致力于为大规模数据处理构建基于 CXL 3.0 的智能内存半导体。

他将 LLM 服务本质上定义为“集群效率问题”,认为如何存储和复用 KV 缓存决定了性能和成本。他的演讲介绍了通过 LMCache 进行的 KV 缓存分层和路由,以减少对 AI 加速器内存的依赖,并探讨了将 CXL 内存作为大容量缓存扩展层,形成内存架构中的新一层级。

结论是:LLM 基础设施优化正从计算领域转向对数据移动和内存架构本身的优化。

Track 1 — 议题 2:从开源模型到生产服务

来自 Upstage(Solar LLM 的开发商)的 Inseo Song 分享了将开源模型部署为可靠生产服务的工程历程。演讲重点强调了模型训练完成后随之而来的工程复杂性。

他详细介绍了为满足多样化需求(OpenAI 兼容 API、多轮对话、推理、函数调用和结构化输出)而设计的 Chat Templates,以及构建能够进行 Token 级状态解析的结构。他还解释了如何在 vLLM 集成过程中使用解析器和 Logits 处理器,从而对生成行为进行精细控制。

核心结论是:“稳定服务”是一个远比“构建好模型”复杂得多的问题。

Track 2 — 议题 1:企业中的 LLM 运营策略

三星电子的 Sungsu Kim 以“使用 vLLM 保护敏感数据”为题进行了演讲。开场即明确观点:在企业部署中,安全性是至关重要的因素。

他分享了一个关于消除数据泄露风险的案例研究:在无法使用外部 SaaS 模型的环境中,通过在内部 GPU 基础设施上构建私有 LLM API,并将所有请求通过物理隔离的封闭网络路由来实现。该系统目前通过 OpenWebUI、OpenAI 兼容 API、Dify 和 Claude Code 等接口为超过 4000 名员工提供服务。他还介绍了基于任务分离的 RAG 代理如何结合访问控制结构来保护敏感数据,同时利用开源工具最大限度地减少定制开发。

该议题清晰地表明:技术性能只是等式的一部分,安全架构和运营设计同样重要。

Track 2 — 议题 2:多模态时代的推理架构

最后一个议题由 NAVER Cloud 的 Jaeeun Gil 带来,主题是 HyperCLOVA Omni 模型的服务化。Omni 模态模型同时处理文本、图像和音频,结合了自回归架构和基于扩散(Diffusion)的解码器,结构异构,难以用传统方法高效处理。

提出的解决方案是解耦服务架构:将编码器、LLM 和解码器分离为独立阶段并分别优化。分析发现视觉解码器是主要的延迟瓶颈,占了端到端延迟的大部分。通过序列并行和内核优化,团队实现了超过 3 倍的性能提升。

本次演讲展示了 LLM 服务如何从单一模型执行演变为复杂的、多组件流水线优化问题。

结语:围绕 vLLM 重塑 LLM 基础设施


贯穿每个议题的主题是一致的:LLM 服务不再仅仅是快速运行某个模型,它已演变成一个基础设施问题——如何在规模化环境下高效运行多样化的模型、异构硬件和复杂的流水线。除了技术内容外,本次 Meetup 也是亲身见证社区活力和深度的一次机会。

vLLM 处于这一快速转型的中心,硬件供应商、云服务商、AI 服务公司和终端用户都在围绕它构建策略。以 vLLM 为核心的技术和社区将持续扩展,从中分享的基于实战的案例研究也将愈发丰富。