使用 vLLM 运行高效且准确的 NVIDIA Nemotron 3 Nano AI 智能体
1 月 28 日更新:NVIDIA 刚刚发布了 NVFP4 精度的 Nemotron 3 Nano 模型。该模型得到 vLLM 开箱即用的支持,并采用了名为“量化感知蒸馏”(QAD)的新方法,在保持 NVFP4 精度的同时,使 B200 上的吞吐量达到 FP8-H100 的 4 倍。您可以点击此处下载 NVFP4 检查点,并使用此 NVIDIA Brev 启动器运行它们。
我们很高兴发布由 vLLM 支持的 NVIDIA Nemotron 3 Nano。
Nemotron 3 Nano 是新发布的 Nemotron 3 系列的一部分,该系列是构建智能体 AI 应用的高效开源模型,并具备领先的精度。Nemotron 3 系列模型采用了混合 Mamba-Transformer MoE 架构和 100 万 token 的上下文长度。这使得开发人员能够跨复杂的、多文档和长周期的操作构建可靠的高吞吐量智能体。
Nemotron 3 Nano 是完全开放的,包括开放权重、数据集和配方,因此开发人员可以轻松地在自己的基础设施上定制、优化和部署模型,以实现最大限度的隐私和安全。下图显示,Nemotron 3 Nano 位于 Artificial Analysis 开源与智能指数中最具吸引力的象限。

图 1:NVIDIA Nemotron 3 为开源 AI 设定了新标准
Nemotron 3 Nano 在编码、推理和智能体任务方面表现卓越,并在 SWE Bench Verified、GPQA Diamond、AIME 2025、Arena Hard v2 和 IFBench 等基准测试中处于领先地位。
在本篇博客文章中,我们将分享如何开始使用 vLLM 运行 Nemotron 3 Nano 推理,以实现大规模、高效率的 AI 智能体。
关于 Nemotron 3 Nano
- 架构
- 采用混合 Transformer-Mamba 架构的专家混合模型 (MoE)
- 支持思维预算(Thinking Budget),以最低的推理 token 生成量提供最佳精度
- 精度
- 在编码、科学推理、问题解决、数学、指令遵循和对话方面具有领先精度
- 模型规模:30B 参数,其中 3B 为激活参数
- 上下文长度:100 万
- 模型输入:文本
- 模型输出:文本
- 支持的 GPU:NVIDIA RTX Pro 6000、DGX Spark、H100、B200。
- 入门指南
- 从 Hugging Face 下载模型权重 - BF16, FP8
- 使用 vLLM 进行推理
- 技术报告,了解如何利用 Nemotron 技术构建自定义、优化的模型。
使用 vLLM 运行优化后的推理
Nemotron 3 Nano 通过 BF16 和 FP8 精度支持,实现了加速的 推理,并能在同一 GPU 上处理更多请求。请按照以下说明开始使用。
运行以下命令安装 vLLM。
VLLM_USE_PRECOMPILED=1 pip install git+https://github.com/vllm-project/vllm.git@main 然后,我们可以通过兼容 OpenAI 的 API 来提供此模型服务
export VLLM_ATTENTION_BACKEND=FLASHINFER
# BF16
```bash
vllm serve --model "nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-BF16" \
--dtype auto \
--trust-remote-code \
--served-model-name nemotron \
--host 0.0.0.0 \
--port 5000 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser deepseek_r1
```
OR
```bash
python -m vllm.entrypoints.openai.api_server \
--model "nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-BF16" \
--dtype auto \
--trust-remote-code \
--served-model-name nemotron \
--host 0.0.0.0 \
--port 5000 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser deepseek_r1
```
# Swap out model name for FP8
```bash
vllm serve --model "nvidia/NVIDIA-Nemotron-Nano-3-30B-A3B-FP8" \
--dtype auto \
--trust-remote-code \
--served-model-name nemotron \
--host 0.0.0.0 \
--port 5000 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning_parser deepseek_r1
```
服务器启动并运行后,您可以使用以下代码片段对模型进行提示
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:5000/v1", api_key="null")
# Simple chat completion
resp = client.chat.completions.create(
model="nemotron",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Write a haiku about GPUs."}
],
temperature=0.7,
max_tokens=256,
)
print(resp.choices[0].message.reasoning_content, resp.choices[0].message.content)如需更简单的 vLLM 设置,请参考我们的入门指南,点击此处获取。
高效且在智能体任务中具备领先精度
Nemotron 3 Nano 基于我们 Nemotron Nano 2 模型的混合 Mamba-Transformer 架构构建,将标准的前馈网络 (FFN) 层替换为稀疏 MoE 层,并将大部分注意力层替换为 Mamba-2。MoE 层帮助我们以极少的激活参数量实现了更好的精度。凭借 MoE 架构,Nemotron 3 Nano 降低了计算需求,并满足了实际应用中严格的延迟要求。
得益于混合 Mamba-Transformer 架构,Nemotron 3 Nano 提供了高达 4 倍的 Token 吞吐量,使模型能够更快地进行思考并同时提供更高的精度。“思维预算”功能可防止模型过度思考,并优化以实现更低、可预测的推理成本。

图 2:Nemotron 3 Nano 在开源推理模型中提供了更高的吞吐量和领先的精度
Nemotron 3 Nano 在 NVIDIA 精选的高质量数据上进行训练,在 SWE Bench Verified、GPQA Diamond、AIME 2025、Arena Hard v2 和 IFBench 等基准测试中处于领先地位,在编码、推理、数学和指令遵循方面表现出顶尖的精度。这使其成为构建金融、网络安全、软件开发和零售等各种企业用例 AI 智能体的理想选择。

图 3:Nemotron 3 Nano 在各种流行的学术基准测试中,在开源小型推理模型中提供了领先的精度
开始使用
总结来说,Nemotron 3 Nano 有助于在各行各业构建可扩展且经济高效的智能体 AI 系统。通过开放的权重、训练数据集和配方,开发人员可以获得完全的透明度和灵活性,以便在从本地到云端的任何环境中微调和部署模型,从而实现最大限度的安全性和隐私保护。
准备好构建企业级智能体了吗?
分享您的想法 并为关键议题投票,共同塑造 Nemotron 的未来。
订阅 NVIDIA 新闻,并通过关注 NVIDIA AI 在 LinkedIn, X, YouTube 以及 Discord 上的 Nemotron 频道,以获取 NVIDIA Nemotron 的最新资讯。