
vLLM x Novita AI:用于生产级外部 KV 缓存的 PegaFlow
·13 分钟阅读
摘要:通过与 Novita AI 合作,PegaFlow 作为用于 LLM 推理的外部 KV 缓存服务集成到 vLLM 中,它作为一个独立的 Rust 进程实现,并通过外部接口连接...
4 文章

摘要:通过与 Novita AI 合作,PegaFlow 作为用于 LLM 推理的外部 KV 缓存服务集成到 vLLM 中,它作为一个独立的 Rust 进程实现,并通过外部接口连接...

TurboQuant 是一种 KV 缓存量化方法,最近因其通过超低比特位量化而带来的巨大显存节省,在社区中获得了广泛关注...
TL;DR:智能体工作负载会生成大量共享前缀,这些前缀通常在不同轮次间反复计算。通过将 Mooncake 的分布式 KV 缓存存储集成到 vLLM,我们实现了 3.8 倍的吞吐量提升……

长上下文 LLM 推理正日益受到内存瓶颈的限制:对于标准的完整注意力解码器,在上下文超过 128k 时,KV 缓存往往会占据大部分 GPU 内存,且每个解码步骤都必须读取大量...