通过 vLLM、Speculators 和 LLM Compressor 加速 Laguna XS.2 推理
随着各组织越来越多地采用人工智能驱动的开发工具,对能够兼顾准确性和运行效率的高性能智能体模型的需求变得至关重要。Laguna XS.2 是 Poolside 在 Laguna 系列中推出的首款开放权重模型:这是一款专为智能体编码和长程软件任务构建的 33B-A3B MoE(混合专家)模型。作为 Laguna XS.2 发布的一部分,Red Hat AI 与 Poolside 在服务和推理优化方面进行了合作,包括一流的 vLLM 集成、DFlash 投机采样检查点以及使用 LLM Compressor 构建的量化检查点。此次发布标志着生产级 AI 部署的一个重要里程碑,Laguna XS.2 的量化检查点和投机采样检查点已针对现实世界智能体应用中的速度和效率进行了优化。
通过 vLLM 集成实现无缝推理
在与 Poolside 的合作下,Laguna XS.2 在发布时便直接作为一等公民集成到了 vLLM 中,从而支持通过标准 vLLM API 进行即时部署。
使用 DFlash 投机采样优化性能
为了进一步加速推理,Red Hat 团队使用 Speculators 库为 Laguna XS.2 训练了一个 DFlash 投机采样器。
DFlash 算法是目前投机采样领域的尖端技术。该模型使用了一个小型 5 层、0.6B 参数的草稿模型,并结合目标模型 Laguna XS.2 的隐藏状态输入,通过单次前向传递来预测一系列 token。这些 token 随后由 Laguna XS.2 模型进行单次验证。此验证步骤保证了与仅使用大型模型时相同的生成质量;如果 token 被接受,那么它们的生成速度将远快于使用 Laguna XS.2 进行自回归逐个生成 token 的速度。其核心在于通过训练 DFlash 来准确预测 Laguna XS.2 极有可能接受的 token。
该模型在来自 Ultrachat 200k SFT 和 Magpie-Align 的 50 万个样本上进行了训练。从每个数据集中采样提示词,并重新生成 Laguna XS.2 的响应(启用思考模式)。该模型随后使用余弦调度器训练了 6 个 epoch,最大学习率为 6e-4,序列长度为 8192,并为每个序列随机采样了 3072 个块位置。
其成果是一个 5 层的草稿模型,能够通过单次前向传递预测 8 个 token。在 Laguna XS.2 验证下,它在可证明不损失生成质量的前提下,将 token 生成速度提升了 2-3 倍。

DFlash 算法代表了投机采样的下一代技术,超越了 Eagle-3 范式,提供了更快、并行的草稿生成方式,显著降低了 token 间延迟。如需亲自测试该投机采样器,请查看 vLLM 食谱 (recipe)。
使用 LLM Compressor 的量化检查点
Poolside 团队还使用 LLM Compressor 库发布了量化的 Laguna XS.2 检查点。这些检查点包含 FP8、NVFP4 以及 compressed-tensors 格式的 INT4/INT8 变体,旨在确保在 vLLM 中实现高效部署的同时保持模型质量。
LLM Compressor 为将各种量化技术应用于大模型提供了一个灵活的框架。利用这些检查点,开发者可以选择最适合其硬件、延迟和内存需求的 Laguna XS.2 变体。
后续步骤
- 在 Hugging Face Hub 上探索 Laguna XS.2 模型
- 使用 LLM Compressor 和 Speculators 优化您自己的模型