
使用 AutoRound 量化加速 vLLM-Omni 推理
我们很高兴地宣布,Intel 的最先进后训练量化 (PTQ) 算法 —— AutoRound 已完全集成到 vLLM-Omni 中,实现了精简的“量化一次”工作流……
15 文章

我们很高兴地宣布,Intel 的最先进后训练量化 (PTQ) 算法 —— AutoRound 已完全集成到 vLLM-Omni 中,实现了精简的“量化一次”工作流……

深入探讨在 NVIDIA DGX Spark 和 GB10 系统上运行 vLLM 的技术细节,内容涵盖 sm_121 架构、统一内存行为、NVFP4 模型服务、Nemotron-3-Super 配置、Docker 部署、Prometheus 指标以及本地评估结果。

长期以来,启用 AMD 支持意味着“移植”,即仅仅让代码能运行。那个时代已经结束了。

DeepSeek-V3.2 (NVFP4 + TP2) 已在 GB300 (SM103 - Blackwell Ultra) 上成功顺利运行。利用 FP4 量化,单 GPU 吞吐量达到了 7360 TGS (每 GPU 每秒 Token 数)...

继我们之前通过 wide-EP 实现 2.2k tok/s/H200 解码吞吐量的工作之后,vLLM 团队继续致力于针对 NVIDIA GB200 平台的性能优化。这篇博客...

摘要:通过与开源社区的合作,vLLM + NVIDIA 在运行于 NVIDIA Blackwell GPU 上的 gpt-oss-120b 模型上实现了显著的性能里程碑。通过深度...

我们正在致力于构建混合模型 (MoM) 的系统级智能,将集体智能引入 LLM 系统。

在过去的几个月里,AMD 与 vLLM SR 团队展开合作,将 vLLM 语义路由 (VSR) 引入 AMD GPU——这不仅仅是一次性能优化,更是……

在不牺牲精度的前提下,实现更快、更高效的大模型服务!

Intel® Arc™ Pro B 系列 GPU 提供强大的 AI 功能,专注于易用性和出色的性价比。其大内存容量和可扩展性……

vLLM TPU 现在由 tpu-inference 提供支持,这是一个极具表现力且功能强大的新型硬件插件,将 JAX 和 PyTorch 统一在单一的底层路径下。它不仅比上一代更快……

在过去的几个月里,我们一直与 NVIDIA 密切合作,旨在充分发挥其最新的 NVIDIA Blackwell GPU 架构 (B200/GB200) 在大语言模型上的潜力...

自 2024 年 12 月以来,通过 vLLM 社区与 vLLM 上昇腾(Ascend)团队的共同努力,我们完成了硬件可插拔 RFC。该提案允许将硬件集成到 vLLM 中……

简单总结:AMD ROCm 上的 vLLM 现在拥有更好的 FP8 性能!

简单总结:vLLM 在 AMD MI300X 上释放了惊人的性能,在 Llama 3.1 405B 上实现了比 Text Generation Inference (TGI) 高 1.5 倍的吞吐量和 1.7 倍的首个 Token 时间 (TTFT)...