使用 vLLM 运行 NVIDIA Nemotron 3 Nano Omni 以实现高效多模态智能体 AI

7 分钟阅读
NVIDIA Nemotron 团队

我们很高兴 vLLM 能够支持新发布的 NVIDIA Nemotron 3 Nano Omni 模型。

Nemotron 3 Nano Omni 是 Nemotron 3 开放模型系列的一员,是一款高效的开放多模态模型,具备领先的准确度,专为驱动能够在单一循环中感知并推理视觉、音频和语言的子智能体而构建。

企业级智能体工作流本质上是多模态的。智能体必须解读屏幕、文档、音频、视频和文本,且通常需要在同一次推理过程中完成。然而,目前大多数智能体系统通过将视觉、语音和语言模型分别拼凑在一起,增加了推理跳转次数,复杂化了编排,并导致上下文在流水线中碎片化。

Nemotron 3 Nano Omni 解决了这种碎片化带来的两个主要挑战:

  • 模型碎片化:按顺序运行单独的视觉、音频和语言模型会通过重复的推理过程增加延迟,放大成本和故障模式,并使模态间的上下文碎片化。Nemotron 3 Nano Omni 将其折叠为一个单一的多模态推理循环——一个能够同时理解屏幕、文档、音频和视频的模型,显著简化了智能体的工作流设计,并降低了编排开销。
  • 效率:持续的感知工作负载(如屏幕监控、文档理解、视频分析)需要在规模化下保持持续运行。Nemotron 3 Nano 的混合 MoE(专家混合)架构在每次前向传递中仅激活 300 亿参数中的 30 亿,提供高吞吐量,并通过时间感知感知和高效的视频采样降低了视频推理的计算量,使始终在线的智能体能够以合理的成本运行。

使用该模型,AI 系统将比其他同等交互水平的开放式 Omni 模型实现 9 倍的吞吐量提升,在不牺牲响应速度的情况下降低成本并提高可扩展性。

摘要:关于 Nemotron 3 Nano Omni

  • 架构:混合 Transformer-Mamba 架构的专家混合(MoE)
  • 模型规模:总参数 30B,激活参数 3B
  • 上下文长度:256K
  • 统一视觉和音频编码器:消除了单独的感知模型——一个模型取代了碎片化的多模态堆栈。3D 卷积层 (Conv3D) 实现了对视频中时空数据的高效处理。
  • 模态
    • 输入:文本、图像、视频、音频
    • 输出:文本
  • 效率:在相同的交互水平下,比其他开放式 Omni 模型实现 9 倍的吞吐量。高效视频采样 (EVS) 在相同的计算预算下支持更长的视频处理,通过时间感知感知降低了视频推理的计算量。支持 FP8 和 NVFP4 量化,实现灵活部署。
  • 准确度:相比最佳的开放替代模型,多模态智能水平提高了 20%。
  • 后训练:通过 NVIDIA NeMo RL 和 NeMo Gym 在文本、图像、音频和视频环境中进行多环境强化学习,改进了指令遵循能力,并提高了获得正确多模态答案的收敛性。
  • 支持的 GPU:NVIDIA B200、H100、H200、A100、L40S、DGX Spark 和 RTX 6000

入门指南

使用 vLLM 运行优化后的多模态推理

Nemotron 3 Nano Omni 通过 BF16、FP8 和 NVFP4 精度支持,实现了加速推理,并在同一 GPU 上服务更多请求。请按照以下说明开始操作。

安装 vLLM

pip install vllm[audio]==0.20.0

部署模型

您可以通过兼容 OpenAI 的 API 来服务 Nemotron 3 Nano Omni。根据您的设置需求,设置注意力后端以及任何必要的环境变量。有关 FP8 和 NVFP4 的详细说明,请参考 cookbook。

python3 -m vllm.entrypoints.openai.api_server \
    --model "nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16" \
    --served-model-name nemotron \
    --trust-remote-code \
    --dtype auto \
    --host 0.0.0.0 \
    --port 5000 \
    --tensor-parallel-size 1 \
    --max-model-len 131072 \
    --media-io-kwargs '{"video":{"num_frames":512,"fps":1}}' \
    --video-pruning-rate 0.5 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning-parser nemotron_v3

一旦服务器启动并运行,您就可以使用下面的代码片段发送多模态提示。

from openai import OpenAI
 
client = OpenAI(base_url="http://127.0.0.1:5000/v1", api_key="null")
resp = client.chat.completions.create(
    model="nemotron",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Write a haiku about GPUs."}
    ],
    temperature=1,
    max_tokens=1024,
)
print("Reasoning:", resp.choices[0].message.reasoning,
      "\nContent:", resp.choices[0].message.content)

如需通过 vLLM 进行更简单的设置,请参阅我们的入门 cookbook(可点击此处查看)或使用 NVIDIA Brev Launchable

以领先的准确度实现多模态智能体应用的高效性

Nemotron 3 Nano Omni 针对硬件高效推理进行了优化,并直接与现代推理堆栈(如 vLLM)集成。它支持 FP8 和 NVFP4 量化、NVIDIA 优化内核以及高效视频采样,从而在各种部署环境中提供准确、低延迟且可预测的推理。

通过将这些优化与基于 3D 卷积的时空处理相结合,Nemotron 3 Nano Omni 以更低的计算成本维持高质量的多模态感知,使从工作站到云端系统的各个层面都能保持一致的准确度和响应速度。

图 1 中的性能是在固定交互阈值下评估的,在保持每个用户的令牌速率恒定的同时,测量在不降低实时用户体验的情况下,多文档和视频用例中可以维持的系统总吞吐量。这种方法突出了在不牺牲响应速度或质量的情况下,在真实部署约束下的效率,而不仅仅是峰值并发能力。

多文档与视频处理效率

Pareto curves showing more efficient system capacity for multi-document and video use cases, showcasing a 7.4x and 9.2x higher throughput, respectively, for Nemotron 3 Nano Omni compared to an alternative open omni model.
帕累托曲线显示了多文档和视频用例中更高的系统容量,相比于其他开放式 Omni 模型,Nemotron 3 Nano Omni 的吞吐量分别高出 7.4 倍和 9.2 倍。

图 1:每个模型在固定每用户交互阈值(令牌/秒/用户)下维持的总系统吞吐量,展示了 Nemotron 3 Nano Omni 在多文档和视频用例中分别比替代方案高出 7.4 倍和 9.2 倍的吞吐量。

多模态准确度

A chart showing accuracy improvements across various industry-leading benchmarks for the previous model version, Nemotron Nano VL V2, compared to the new Nemotron 3 Nano Omni model, highlighting high performance for complex document intelligence, and video and audio reasoning.
一张图表展示了前一代模型 Nemotron Nano VL V2 与新的 Nemotron 3 Nano Omni 模型在各项行业领先基准测试中的准确度提升,突出了其在复杂文档智能以及视频和音频推理方面的卓越表现。

图 2:相比上一代 NVIDIA Nemotron Nano VL V2 模型,在行业领先基准测试中的多模态推理准确度提升,凸显了其在复杂文档智能以及视频和音频推理方面的强大表现。

如图 2 所示,Nemotron 3 Nano Omni 持续改进,在视觉、视频、OCR 和音频基准测试中提供了比上一代 NVIDIA Nemotron Nano VL V2 更高的多模态准确度。这些准确度提升与领先的效率相结合,使其在六个多模态排行榜上名列前茅。

An image showing Nemotron 3 Nano Omni winning six industry-leading leaderboards for multimodal efficiency and accuracy, including MMlongbench‑Doc, OCRBenchV2, WorldSense, DailyOmni, VoiceBench, and MediaPerf.
一张图片显示 Nemotron 3 Nano Omni 在六个行业领先的多模态效率和准确度排行榜中夺冠,包括 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 和 MediaPerf。

图 3:Nemotron 3 Nano 在六个多模态效率和准确度排行榜中位居榜首。

该模型在 MMlongbench-Doc 和 OCRBenchV2 等文档智能基准测试中表现出类拔萃,同时在 WorldSense、DailyOmni 和 VoiceBench 等视频和音频理解基准测试中也处于领先地位。在 MediaPerf 基准测试中,Nemotron 3 Nano Omni 在所有任务中均实现了最高吞吐量,并在视频级标注方面实现了最低的推理成本。

在智能体系统中,Nemotron 3 Nano Omni 作为多模态感知和上下文子智能体,赋予智能体通过屏幕、文档、音频流和视频进行“看”和“听”的能力,同时将结构化的理解信息馈送给下游的编排和执行智能体。其轻量级架构使其能够与系统中的其他模型高效并行运行,而无需在不同的感知流水线中重复计算。它能处理智能体所需的一切视觉和听觉信息。

这使得 Nemotron 3 Nano Omni 成为驱动计算机使用智能体、文档智能工作流和音视频理解流水线的强大选择——且无需维护碎片化多模态堆栈的开销。

开始使用

NVIDIA Nemotron 3 Nano Omni 是一款具备最高效率的开放多模态模型,可驱动子智能体在视觉、音频和语言任务中更快地完成工作。凭借开放的权重、数据集和方案,您将获得完全的透明度,并有能力在您自己的基础设施(从工作站到云端)上进行微调和部署。

准备好大规模运行多模态 AI 智能体了吗?

订阅 NVIDIA 新闻,并在 LinkedInXYouTube 以及 Discord 上的 Nemotron 频道关注 NVIDIA AI,以了解有关 NVIDIA Nemotron 的最新动态。

致谢

感谢所有为将 Nemotron 3 Nano Omni 引入 vLLM 做出贡献的人们。

  • NVIDIA: Nirmal Kumar Juluru, Anusha Pant
  • vLLM 团队与社区: Roger Wang, Michael Goin, Thomas Parnell, Kevin Luu, Robert Shaw, Tyler Michael Smith