在 vLLM 上发布 Gemma 4:字节对字节,最强大的开源模型
通过先进的推理和多模态能力提升开源模型
随着 Gemma 4 的发布,vLLM 现已全面支持 Google 最尖端的开源模型系列。vLLM 覆盖多种硬件后端,并首次在 Google TPU、AMD GPU 和 Intel XPU 上实现“Day 0”支持。Gemma 4 专为高级推理和智能体工作流构建,在参数效率方面带来了前所未有的智能水平,现已通过宽松的 Apache 2.0 许可证向 vLLM 社区开放。
Gemma 4 系列采用了与 Gemini 3 相同的世界级研究成果和技术,包含四种多功能尺寸,旨在适配多样的硬件环境:Effective 2B (E2B)、Effective 4B (E4B)、26B 混合专家模型 (MoE) 和 31B 稠密模型。

截至 2 月 1 日,Arena.ai 聊天竞技场上的开源模型性能与尺寸对比。更多基准测试请参阅我们的模型卡。
强大、易用、开放
为推动前沿研究和产品创新的新纪元,Gemma 4 模型经过精确工程设计,可在从数十亿台 Android 设备、本地开发工作站到大规模加速器等各类硬件上高效运行和微调。
通过利用这些高度优化的模型,开发者可以在特定任务上实现顶尖性能。早期成功案例包括 INSAIT 的保加利亚语首发模型 BgGPT,以及耶鲁大学的 Cell2Sentence-Scale,该项目利用 Gemma 4 识别癌症治疗的新型路径。
Gemma 4 是我们迄今为止最先进的开源模型系列,其核心能力包括:
- 高级推理:具备复杂的多步规划能力,在数学和逻辑密集型指令遵循基准测试中实现了重大突破。
- 智能体工作流:原生支持函数调用 (function-calling)、结构化 JSON 和系统指令,能够构建可靠的、可与工具和 API 交互的自主智能体。
- 代码生成:高质量的离线代码支持将任何工作站转化为强大的本地优先 AI 开发环境。
- 视觉与音频:模型可原生处理可变分辨率的图像和视频,在 OCR 和图表理解方面表现出色。边缘模型 (E2B/E4B) 还包含用于语音识别的原生音频输入。
- 更长的上下文:边缘模型提供 128K 上下文窗口,大型变体支持高达 256K,助力无缝处理大规模数据集和代码仓库级的分析。
- 140+ 种语言:原生训练超过 140 种语言,助力开发者为全球用户群创建包容性强、高性能的应用程序。
点击此处阅读 Google 博客,了解更多关于 Gemma 4 在单位参数下领先的智能表现。
硬件支持
vLLM 经过优化,可在业界领先的硬件后端上运行 Gemma 4,使开发者能够以极低的硬件开销实现前沿级能力。vLLM 支持在 Nvidia、AMD、Intel GPU 和 Google TPU 上进行无缝部署,支持设备涵盖从笔记本级显卡到数据中心加速器。
为 vLLM 用户提供的核心能力
- 原生视觉与音频:所有模型均可原生处理图像和视频。小型边缘模型 (E2B/E4B) 还具备用于语音识别的原生音频输入功能。
- 智能体工作流:支持函数调用、结构化 JSON 输出和原生系统指令,助力 vLLM 用户构建可靠的自主智能体。
- 扩展上下文:vLLM 可处理 Gemma 4 的不同上下文窗口——边缘模型高达 128K,大型模型高达 256K,支持长文档处理和代码仓库级分析。
- 全球流畅度:原生训练超过 140 种语言,支持包容性的应用开发。
入门指南
有关技术实现细节,请参阅官方 模型卡 和社区 指南 (Recipes)。
如需在 Google Kubernetes (GKE) 和 Google Compute Engine (GCE) 上开始使用 Gemma 4,请查看我们的快速入门视频和文本演示教程:Trillium、Ironwood 以及 Nvidia GPU。