
vLLM 快速高效的 LLM 推理:DeepLearning.AI 新课程发布
我们很高兴与 Red Hat 和吴恩达的 DeepLearning.AI 共同宣布推出一门实践课程,该课程将深入讲解 LLM 基础知识,以及完整的 AI 部署生命周期(包括优化、部署和基准测试)...
20 文章

我们很高兴与 Red Hat 和吴恩达的 DeepLearning.AI 共同宣布推出一门实践课程,该课程将深入讲解 LLM 基础知识,以及完整的 AI 部署生命周期(包括优化、部署和基准测试)...

长视域 LLM 代理产生了一个路由问题,单轮提示路由器并不能解决该问题。路由器仍然需要知道哪种模型最适合当前的请求,但它还需要……

v0.5.0 版本在推测解码模型训练方面带来了重大的架构改进,引入了 DFlash 算法支持、完全统一的在线训练能力,以及...

大多数路由系统从提示词开始并选择模型端点。vLLM 语义路由器 (VSR) 做出了不同的押注:在请求到达服务模型之前,系统应提取...

我们很高兴地宣布发布 VeRL-Omni 的预发布版本。这是一个专注于多模态生成模型的通用强化学习 (RL) 后训练框架,构建在 verl 和 vllm-omni 之上。

自 v0.1 Iris 发布以来,vLLM Semantic Router 取得了巨大的飞跃。在同一个发布周期内,该项目重建了模型栈,将路由功能扩展到了安全性、语义缓存、内存、检索等领域……

我们正在致力于构建混合模型 (MoM) 的系统级智能,将集体智能引入 LLM 系统。

vLLM Semantic Router 是混合模型 (MoM) 的系统级智能,将集体智能引入 LLM 系统。它位于用户和模型之间,从……中捕获信号

作为一名热情的 vLLM 社区成员,希望看到 vLLM 蓬勃发展并触及更多开发者,我很高兴宣布 vLLM Playground —— 一个功能丰富的现代 Web 界面,用于管理和……

我们非常高兴地宣布 vLLM-Omni 的一次重大性能更新。

在过去的几个月里,AMD 与 vLLM SR 团队展开合作,将 vLLM 语义路由 (VSR) 引入 AMD GPU——这不仅仅是一次性能优化,更是……

你的 LLM 刚刚调用了一个工具,收到了准确的数据,但给出的答案仍然是错的。欢迎来到外在幻觉(extrinsic hallucination)的世界——模型自信地忽略了摆在面前的真实事实……

- 投机采样是提升推理性能的一种优化手段;然而,为每个大语言模型训练一个独特的草稿模型既困难又耗时,而生产就绪的……

在不牺牲精度的前提下,实现更快、更高效的大模型服务!

我们很高兴宣布正式发布 vLLM-Omni,这是 vLLM 生态系统的一个重大扩展,旨在支持下一代 AI:全模态模型。

vLLM 语义路由器的早期版本依赖于基于分类的路由,这是一种直观的方法:将用户查询分类为 14 个 MMLU 领域类别之一,然后……

语义路由系统面临着扩展性挑战。当每个分类请求都需要独立运行多个微调模型时,计算成本会随着模型数量的增加呈线性增长……

在过去的一年里,混合推理和自动路由已越来越多地定义了大模型基础设施的进展——将争论焦点从原始规模转移到单 Token 效率、延迟……

今天,我们很高兴发布 vllm-project/aibrix:由字节跳动开发、功能完备的 vLLM Kubernetes 服务栈。AIBrix 始于 2024 年初,已成功部署到……
- vLLM 拥有最大的开源社区,但要将 vLLM 从最好的单节点 LLM 引擎转化为一流的 LLM 服务系统,需要做些什么? - 今天,我们发布了“vLLM...