
使用 AutoRound 量化加速 vLLM-Omni 推理
我们很高兴地宣布,Intel 的最先进后训练量化 (PTQ) 算法 —— AutoRound 已完全集成到 vLLM-Omni 中,实现了精简的“量化一次”工作流……
11 文章

我们很高兴地宣布,Intel 的最先进后训练量化 (PTQ) 算法 —— AutoRound 已完全集成到 vLLM-Omni 中,实现了精简的“量化一次”工作流……

我们很高兴地宣布发布 VeRL-Omni 的预发布版本。这是一个专注于多模态生成模型的通用强化学习 (RL) 后训练框架,构建在 verl 和 vllm-omni 之上。

大语言模型推理传统上基于一个简单的前提:用户提交一个完整的提示词(请求),模型进行处理,并返回一个响应(流式或以……方式)

我们非常高兴地宣布 vLLM-Omni 的一次重大性能更新。

现代大型多模态模型(LMMs)引入了一个独特的服务时瓶颈:在任何文本生成开始之前,所有图像都必须由视觉编码器(例如 ViT)进行处理。此编码器……

我们很高兴宣布正式发布 vLLM-Omni,这是 vLLM 生态系统的一个重大扩展,旨在支持下一代 AI:全模态模型。

介绍共享内存 IPC 缓存——由 Cohere 为 vLLM 项目贡献的高性能缓存机制。通过绕过冗余的进程间通信并保留大型...

我们很高兴发布由 vLLM 支持的 NVIDIA Nemotron Nano 2 VL。这款开源视觉语言模型 (VLM) 专为视频理解和文档智能而构建。

直到最近,生成式 AI 基础设施还紧密耦合在自回归文本生成模型上,即逐个 token 地输出内容(通常是自然语言)。vLLM...

通用语言模型 (GLM) 是由智谱 AI (现更名为 Z.ai) 创建的基础模型系列。GLM 团队与 vLLM 团队有着长期的合作关系,可以追溯到……的早期

我们很高兴宣布 vLLM 现已支持 Llama 4 模型系列:Scout (17B-16E) 和 Maverick (17B-128E)。您可以运行这些强大的长上下文、原生多模态(最高 8-10……