使用 vLLM 运行高效且准确的 NVIDIA Nemotron 3 Nano AI 智能体

5 分钟阅读
NVIDIA Nemotron 团队

1 月 28 日更新:NVIDIA 刚刚发布了 NVFP4 精度的 Nemotron 3 Nano 模型。该模型得到 vLLM 开箱即用的支持,并采用了名为“量化感知蒸馏”(QAD)的新方法,在保持 NVFP4 精度的同时,使 B200 上的吞吐量达到 FP8-H100 的 4 倍。您可以点击此处下载 NVFP4 检查点,并使用此 NVIDIA Brev 启动器运行它们。

我们很高兴发布由 vLLM 支持的 NVIDIA Nemotron 3 Nano。

Nemotron 3 Nano 是新发布的 Nemotron 3 系列的一部分,该系列是构建智能体 AI 应用的高效开源模型,并具备领先的精度。Nemotron 3 系列模型采用了混合 Mamba-Transformer MoE 架构和 100 万 token 的上下文长度。这使得开发人员能够跨复杂的、多文档和长周期的操作构建可靠的高吞吐量智能体。

Nemotron 3 Nano 是完全开放的,包括开放权重、数据集和配方,因此开发人员可以轻松地在自己的基础设施上定制、优化和部署模型,以实现最大限度的隐私和安全。下图显示,Nemotron 3 Nano 位于 Artificial Analysis 开源与智能指数中最具吸引力的象限。


图 1:NVIDIA Nemotron 3 为开源 AI 设定了新标准

Nemotron 3 Nano 在编码、推理和智能体任务方面表现卓越,并在 SWE Bench Verified、GPQA Diamond、AIME 2025、Arena Hard v2 和 IFBench 等基准测试中处于领先地位。

在本篇博客文章中,我们将分享如何开始使用 vLLM 运行 Nemotron 3 Nano 推理,以实现大规模、高效率的 AI 智能体。

关于 Nemotron 3 Nano

  • 架构
    • 采用混合 Transformer-Mamba 架构的专家混合模型 (MoE)
    • 支持思维预算(Thinking Budget),以最低的推理 token 生成量提供最佳精度
  • 精度
    • 在编码、科学推理、问题解决、数学、指令遵循和对话方面具有领先精度
  • 模型规模:30B 参数,其中 3B 为激活参数
  • 上下文长度:100 万
  • 模型输入:文本
  • 模型输出:文本
  • 支持的 GPU:NVIDIA RTX Pro 6000、DGX Spark、H100、B200。
  • 入门指南

使用 vLLM 运行优化后的推理

Nemotron 3 Nano 通过 BF16FP8 精度支持,实现了加速的 推理,并能在同一 GPU 上处理更多请求。请按照以下说明开始使用。

运行以下命令安装 vLLM。

VLLM_USE_PRECOMPILED=1 pip install git+https://github.com/vllm-project/vllm.git@main 

然后,我们可以通过兼容 OpenAI 的 API 来提供此模型服务

export VLLM_ATTENTION_BACKEND=FLASHINFER
 
# BF16
```bash
vllm serve --model "nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-BF16" \
    --dtype auto \
    --trust-remote-code \
    --served-model-name nemotron \
    --host 0.0.0.0 \
    --port 5000 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning-parser deepseek_r1 
```
OR
```bash
python -m vllm.entrypoints.openai.api_server \
    --model "nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-BF16" \
    --dtype auto \
    --trust-remote-code \
    --served-model-name nemotron \
    --host 0.0.0.0 \
    --port 5000 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning-parser deepseek_r1 
```
 
 
# Swap out model name for FP8
```bash
vllm serve --model "nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-FP8" \
    --dtype auto \
    --trust-remote-code \
    --served-model-name nemotron \
    --host 0.0.0.0 \
    --port 5000 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning_parser deepseek_r1
```
 

服务器启动并运行后,您可以使用以下代码片段对模型进行提示

from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:5000/v1", api_key="null")
 
# Simple chat completion
resp = client.chat.completions.create(
    model="nemotron",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Write a haiku about GPUs."}
    ],
    temperature=0.7,
    max_tokens=256,
)
print(resp.choices[0].message.reasoning_content, resp.choices[0].message.content)

如需更简单的 vLLM 设置,请参考我们的入门指南,点击此处获取。

高效且在智能体任务中具备领先精度

Nemotron 3 Nano 基于我们 Nemotron Nano 2 模型的混合 Mamba-Transformer 架构构建,将标准的前馈网络 (FFN) 层替换为稀疏 MoE 层,并将大部分注意力层替换为 Mamba-2。MoE 层帮助我们以极少的激活参数量实现了更好的精度。凭借 MoE 架构,Nemotron 3 Nano 降低了计算需求,并满足了实际应用中严格的延迟要求。

得益于混合 Mamba-Transformer 架构,Nemotron 3 Nano 提供了高达 4 倍的 Token 吞吐量,使模型能够更快地进行思考并同时提供更高的精度。“思维预算”功能可防止模型过度思考,并优化以实现更低、可预测的推理成本。


图 2:Nemotron 3 Nano 在开源推理模型中提供了更高的吞吐量和领先的精度

Nemotron 3 Nano 在 NVIDIA 精选的高质量数据上进行训练,在 SWE Bench Verified、GPQA Diamond、AIME 2025、Arena Hard v2 和 IFBench 等基准测试中处于领先地位,在编码、推理、数学和指令遵循方面表现出顶尖的精度。这使其成为构建金融、网络安全、软件开发和零售等各种企业用例 AI 智能体的理想选择。


图 3:Nemotron 3 Nano 在各种流行的学术基准测试中,在开源小型推理模型中提供了领先的精度

开始使用

总结来说,Nemotron 3 Nano 有助于在各行各业构建可扩展且经济高效的智能体 AI 系统。通过开放的权重、训练数据集和配方,开发人员可以获得完全的透明度和灵活性,以便在从本地到云端的任何环境中微调和部署模型,从而实现最大限度的安全性和隐私保护。

准备好构建企业级智能体了吗?

  • 从 Hugging Face 下载 Nemotron 3 Nano 模型权重 - BF16, FP8
  • 使用此指南通过 vLLM 进行推理

分享您的想法 并为关键议题投票,共同塑造 Nemotron 的未来。

订阅 NVIDIA 新闻,并通过关注 NVIDIA AI 在 LinkedIn, X, YouTube 以及 Discord 上的 Nemotron 频道,以获取 NVIDIA Nemotron 的最新资讯。