
会话感知代理路由:针对长周期 LLM 代理的连续性感知模型选择
长视域 LLM 代理产生了一个路由问题,单轮提示路由器并不能解决该问题。路由器仍然需要知道哪种模型最适合当前的请求,但它还需要……
31 文章

长视域 LLM 代理产生了一个路由问题,单轮提示路由器并不能解决该问题。路由器仍然需要知道哪种模型最适合当前的请求,但它还需要……

大多数路由系统从提示词开始并选择模型端点。vLLM 语义路由器 (VSR) 做出了不同的押注:在请求到达服务模型之前,系统应提取...

EAGLE 系列(包括 EAGLE 1、EAGLE 2 和 EAGLE 3)已成为研究和实际部署中最广泛采用的投机采样算法家族之一...

摘要:通过与 Novita AI 合作,PegaFlow 作为用于 LLM 推理的外部 KV 缓存服务集成到 vLLM 中,它作为一个独立的 Rust 进程实现,并通过外部接口连接...

vLLM 如何构建了 DeepSeek V3.2、MiniMax-M2.5 和 Qwen 3.5 397B 的领先部署方案。

长上下文 LLM 推理正日益受到内存瓶颈的限制:对于标准的完整注意力解码器,在上下文超过 128k 时,KV 缓存往往会占据大部分 GPU 内存,且每个解码步骤都必须读取大量...

我们很高兴地宣布推出 Model Runner V2 (MRV2),这是对 vLLM 模型运行器的从零重构。MRV2 带来了更简洁、更模块化、更高效的执行核心——且无需修改 API...

EAGLE 是目前大型语言模型 (LLM) 推理中投机采样领域最先进的方法,但其自回归草稿生成过程会产生一个隐蔽的瓶颈:生成的 Token 越多...

本文改编自 Red Hat 主办的 vLLM 办公时间 (Office Hours) 会话,邀请了来自 IBM Research 的 Burkhard Ringlein,对 vLLM Triton Attention 后端进行了深入的技术讲解....

长期以来,启用 AMD 支持意味着“移植”,即仅仅让代码能运行。那个时代已经结束了。

运行多个定制 AI 模型(尤其是近期的混合专家 (MoE) 模型系列)的组织和个人,在 GPU 负载空闲时仍需支付高额费用的挑战...

DeepSeek-V3.2 (NVFP4 + TP2) 已在 GB300 (SM103 - Blackwell Ultra) 上成功顺利运行。利用 FP4 量化,单 GPU 吞吐量达到了 7360 TGS (每 GPU 每秒 Token 数)...

继我们之前通过 wide-EP 实现 2.2k tok/s/H200 解码吞吐量的工作之后,vLLM 团队继续致力于针对 NVIDIA GB200 平台的性能优化。这篇博客...

摘要:通过与开源社区的合作,vLLM + NVIDIA 在运行于 NVIDIA Blackwell GPU 上的 gpt-oss-120b 模型上实现了显著的性能里程碑。通过深度...

在这篇文章中,我们将介绍 vLLM 0.11.0 版本中引入的新功能:KV 缓存卸载。我们将重点关注卸载到 CPU 内存 (DRAM) 及其在提升整体...

我们非常高兴地宣布 vLLM-Omni 的一次重大性能更新。

在 v0.11.0 中,vLLM V0 引擎的最后一部分代码被移除,标志着完全迁移到了改进后的 V1 引擎架构。这一成就离不开 vLLM 的...

介绍共享内存 IPC 缓存——由 Cohere 为 vLLM 项目贡献的高性能缓存机制。通过绕过冗余的进程间通信并保留大型...

我们演示了一个开源的、位级一致的在线强化学习运行示例,该示例使用 TorchTitan 作为训练引擎,vLLM 作为推理引擎。基于 vLLM 近期在批处理不变性方面的工作...

多模型服务问题:你有两个 LLM,它们每个都能放进你的 GPU,但不能同时运行。传统的解决方案被迫做出糟糕的权衡

在过去的几个月里,我们一直与 NVIDIA 密切合作,旨在充分发挥其最新的 NVIDIA Blackwell GPU 架构 (B200/GB200) 在大语言模型上的潜力...

当今快速的大语言模型 (LLM) 推理要求在不同的硬件、工作负载和规模上尽可能高效地执行模型。高效的执行需要经过深度优化...

我们很高兴地宣布,vLLM 现已在 NVIDIA Blackwell 和 Hopper GPU,以及 AMD MI300x 和 MI355x GPU 上支持 gpt-oss。在这篇博客文章中,我们将探讨高效的模型...

本文探讨了 MiniMax-M1 的混合架构如何在 vLLM 中得到高效支持。我们讨论了该模型的独特功能、高效推理面临的挑战以及技术实现...

我们很高兴地宣布 vLLM V1 的 alpha 版本发布,这是 vLLM 核心架构的一次重大升级。基于我们在过去一年半开发 vLLM 过程中吸取的经验,我们重新审视了关键...

- 结构化解码允许精确控制 LLM 输出格式 - vLLM 现在支持 outlines 和 XGrammar 后端进行结构化解码 - 最近的 XGrammar 集成带来了高达 5 倍的...

简单总结:vLLM 在 AMD MI300X 上释放了惊人的性能,在 Llama 3.1 405B 上实现了比 Text Generation Inference (TGI) 高 1.5 倍的吞吐量和 1.7 倍的首个 Token 时间 (TTFT)...

vLLM 中的投机采样是一种强大的技术,通过结合使用小型和大型模型来加速 Token 生成。在本博客中,我们将解析投机采样在...

简而言之:vLLM 在 Llama 8B 模型上实现了 2.7 倍的高吞吐量和 5 倍的更短 TPOT(每个输出 token 的时间),在 Llama 70B 模型上实现了 1.8 倍的吞吐量和 2 倍的更短 TPOT。

- vLLM 在常见场景中与 DeepSpeed-FastGen 的速度持平,并在处理较长输出时超越了它。- DeepSpeed-FastGen 仅在提示词较长且输出较短的场景中优于 vLLM...

LLM 有望从根本上改变我们在各行各业使用 AI 的方式。然而,实际部署这些模型具有挑战性,即使在昂贵的硬件上,速度也可能出奇地慢。今天我们...