
使用 AutoRound 量化加速 vLLM-Omni 推理
·阅读需 10 分钟
我们很高兴地宣布,Intel 的最先进后训练量化 (PTQ) 算法 —— AutoRound 已完全集成到 vLLM-Omni 中,实现了精简的“量化一次”工作流……
8 文章

我们很高兴地宣布,Intel 的最先进后训练量化 (PTQ) 算法 —— AutoRound 已完全集成到 vLLM-Omni 中,实现了精简的“量化一次”工作流……

随着各机构越来越多地采用 AI 驱动的开发工具,对兼具准确性和运行效率的高性能智能体模型的需求变得至关重要。Laguna...

TurboQuant 是一种 KV 缓存量化方法,最近因其通过超低比特位量化而带来的巨大显存节省,在社区中获得了广泛关注...

长上下文 LLM 推理正日益受到内存瓶颈的限制:对于标准的完整注意力解码器,在上下文超过 128k 时,KV 缓存往往会占据大部分 GPU 内存,且每个解码步骤都必须读取大量...

DeepSeek-V3.2 (NVFP4 + TP2) 已在 GB300 (SM103 - Blackwell Ultra) 上成功顺利运行。利用 FP4 量化,单 GPU 吞吐量达到了 7360 TGS (每 GPU 每秒 Token 数)...

在不牺牲精度的前提下,实现更快、更高效的大模型服务!

简单总结:AMD ROCm 上的 vLLM 现在拥有更好的 FP8 性能!

今天,vLLM 团队很高兴与 Meta 合作宣布支持 Llama 3.1 模型系列。Llama 3.1 带来了令人兴奋的新功能,包括更长的上下文长度(高达 128K...