使用 vLLM 运行高效且准确的 NVIDIA Nemotron 3 Super 多智能体 AI

5 分钟阅读
NVIDIA Nemotron 团队

我们很高兴在 vLLM 上支持最新发布的 NVIDIA Nemotron 3 Super 模型。

Nemotron 3 Super 是 Nemotron 3 开源模型家族的一员,专为复杂的多智能体应用进行了优化。如今的智能体 AI 系统依赖多个模型来进行规划、推理和执行复杂的多步骤任务。这些模型既需要具备解决复杂技术挑战所需的深度,也需要在大规模连续运行下保持高效。

Nemotron 3 Super 是一款开放的混合专家模型(MoE),拥有 1200 亿参数,但在推理时仅激活 120 亿参数。这一设计实现了极高的计算效率和领先的精度,特别适用于复杂的多智能体应用。它解决了大规模智能体系统中的两大主要挑战:

  • “上下文爆炸”问题:多智能体系统由于频繁重发历史记录、工具输出和推理步骤,往往会生成过多的 Token。Nemotron 3 Super 通过 100 万 Token 的超大上下文窗口解决了这一问题,为智能体提供了长期记忆,并显著减少了目标偏离。
  • “思维税”:在传统的大规模模型上运行推理密集型智能体,成本高昂且速度缓慢。其混合 MoE 架构提供了高达 4 倍的吞吐量,通过允许复杂的智能体在处理每个子任务时无需承受高延迟和高成本,从而有效化解了这一负担。

图 1:Artificial Analysis 图表显示,Nemotron 3 Super 在智能与开放性对比中处于领先地位(对比主流开源模型)

如上图所示,Nemotron 3 Super 在 Artificial Analysis 的开放性指数中处于领先地位。与其他开源模型相比,Nemotron 完全开放,包括模型权重、数据集和训练配方,因此开发者可以轻松地在自己的基础设施上进行定制、优化和部署,以实现最高程度的隐私和安全保障。

在本篇博文中,我们将分享如何使用 vLLM 进行推理来上手 Nemotron 3 Super,从而大规模解锁高效、高精度的多智能体 AI。

关于 Nemotron 3 Super

  • 架构:混合专家模型(MoE),采用混合 Transformer-Mamba 架构
  • 同尺寸类别中吞吐效率最高,且较上一代 Nemotron Super 模型吞吐量提升高达 5 倍
  • 多 Token 预测(MTP):通过在单次前向传递中同时预测多个未来 Token,MTP 极大地加速了长文本的生成
  • 支持思维预算(Thinking Budget),以最少的推理 Token 生成实现最优精度

关键规格

  • 精度:在 Artificial Analysis 智能指数的同尺寸类别中精度领先;较上一代 Nemotron Super 模型精度提升高达 2 倍
  • 潜在 MoE(Latent MoE):仅需一个专家推理的成本即可调用 4 个专家
  • 模型规模:总参数 120B,激活参数 12B
  • 上下文长度:高达 1M
  • 模型输入/输出:文本输入,文本输出
  • 支持的 GPU:B200, H100, DGX Spark, RTX 6000

入门指南

  • Hugging Face 下载模型权重 - 支持 BF16, FP8 和 NVFP4
  • 使用 vLLM 进行推理
  • 阅读 技术报告了解更多详情

使用 vLLM 运行优化后的推理

Nemotron 3 Super 通过支持 BF16、FP8 和 NVFP4 精度,实现了推理加速,并能在同一块 GPU 上服务更多请求。Blackwell 架构上的 NVFP4 相比 H100 上的 FP8,在保持精度的同时提供了 4 倍的吞吐量。请按照以下说明开始使用。

安装 vLLM

pip install vllm==0.17.1

模型服务

你可以通过兼容 OpenAI 的 API 来运行 Nemotron 3 Super 服务。下面的命令针对 4x H100 设置进行了配置。如果你的硬件有所不同,请根据你的环境调整并行度标志及相关设置。关于 FP8 和 NVFP4 的详细说明,请参阅相关手册。

# BF16
vllm serve nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
    --kv-cache-dtype fp8 \
    --tensor-parallel-size 4 \
    --trust-remote-code \
    --served-model-name nemotron \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning-parser nemotron_v3

服务器启动并运行后,你可以使用以下代码片段向模型发送请求

from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:5000/v1", api_key="null")
 
# Simple chat completion
resp = client.chat.completions.create(
    model="nemotron",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Give me 3 bullet points about vLLM"}
    ],
    temperature=0.7,
    max_tokens=256,
)
print("Reasoning:", resp.choices[0].message.reasoning_content,
      "\nContent:", resp.choices[0].message.content)

如需更简单的 vLLM 设置,请参阅我们的入门手册,点击此处或使用 NVIDIA Brev 启动器

以卓越的精度为多智能体应用提供最高效率


图 2:Artificial Analysis 图表显示,Nemotron 3 Super 在智能与效率对比中处于领先地位(对比同尺寸主流开源模型)

如上图所示,该模型在 Artificial Analysis 基准测试中以更高的效率实现了领先的精度,这使其成为需要兼顾效率与能力的多智能体系统的强有力选择。

入门指南

Nemotron 3 Super 助力你构建可扩展、高性价比且具备高精度的多智能体 AI。通过开放的权重、数据集和训练配方,你可以获得完全的透明度,并灵活地在从工作站到云端的任何基础设施上进行微调和部署。

准备好大规模运行多智能体 AI 了吗?

通过订阅 NVIDIA 新闻并关注 NVIDIA AI 的 LinkedIn, X, YouTube 以及 Discord 上的 Nemotron 频道,随时了解 NVIDIA Nemotron 的最新动态。

致谢

感谢所有为将 Nemotron 3 Super 引入 vLLM 做出贡献的人们。

  • NVIDIA: Nirmal Kumar Juluru, Anusha Pant
  • vLLM 团队及社区: Roger Wang, Michael Goin, Thomas Parnell, Kevin Luu, Robert Shaw, Tyler Michael Smith