
通过 vLLM、Speculators 和 LLM Compressor 加速 Laguna XS.2 推理
·3 分钟阅读
随着各机构越来越多地采用 AI 驱动的开发工具,对兼具准确性和运行效率的高性能智能体模型的需求变得至关重要。Laguna...
9 文章

随着各机构越来越多地采用 AI 驱动的开发工具,对兼具准确性和运行效率的高性能智能体模型的需求变得至关重要。Laguna...

v0.5.0 版本在推测解码模型训练方面带来了重大的架构改进,引入了 DFlash 算法支持、完全统一的在线训练能力,以及...

EAGLE 系列(包括 EAGLE 1、EAGLE 2 和 EAGLE 3)已成为研究和实际部署中最广泛采用的投机采样算法家族之一...

vLLM 如何构建了 DeepSeek V3.2、MiniMax-M2.5 和 Qwen 3.5 397B 的领先部署方案。

PR #33736(包含在 vllm>=v0.18.0 中)为 vLLM 引入了一套全新的隐藏状态提取系统。本篇博客探讨了该功能的动机、设计、用法、未来方向及其...

EAGLE 是目前大型语言模型 (LLM) 推理中投机采样领域最先进的方法,但其自回归草稿生成过程会产生一个隐蔽的瓶颈:生成的 Token 越多...

- 投机采样是提升推理性能的一种优化手段;然而,为每个大语言模型训练一个独特的草稿模型既困难又耗时,而生产就绪的……

在这篇文章中,我将逐步介绍构成现代高吞吐量 LLM 推理系统的所有核心组件和高级功能。特别是,我将进行详细拆解……

vLLM 中的投机采样是一种强大的技术,通过结合使用小型和大型模型来加速 Token 生成。在本博客中,我们将解析投机采样在...