
vLLM x Novita AI:用于生产级外部 KV 缓存的 PegaFlow
·13 分钟阅读
摘要:通过与 Novita AI 合作,PegaFlow 作为用于 LLM 推理的外部 KV 缓存服务集成到 vLLM 中,它作为一个独立的 Rust 进程实现,并通过外部接口连接...
4 文章

摘要:通过与 Novita AI 合作,PegaFlow 作为用于 LLM 推理的外部 KV 缓存服务集成到 vLLM 中,它作为一个独立的 Rust 进程实现,并通过外部接口连接...
TL;DR:智能体工作负载会生成大量共享前缀,这些前缀通常在不同轮次间反复计算。通过将 Mooncake 的分布式 KV 缓存存储集成到 vLLM,我们实现了 3.8 倍的吞吐量提升……

将 Mamba 风格的 SSM 层与标准全注意力 (FA) 层交错的混合架构(例如 NVIDIA Nemotron-H)正日益受到关注,这被视为结合线性时间复杂度...
摘要:预填充和解码任务竞争相同的 GPU,导致负载下 ITL(首字延迟)激增。我们展示了如何使用 AMD 的 MORI-IO 连接器在单个 8-GPU MI300X 节点上对它们进行解耦,从而实现 2.5 倍的性能提升...