← 返回AI精选
大语言模型

NVIDIA Nemotron

NVIDIA 开源模型家族,Mamba-MoE 混合架构,最高 1M 上下文,面向 Agent 工作流与私有化部署。

模型与定位

NVIDIA Nemotron 3 是 2026 年 3-6 月发布的开放模型家族,采用 LatentMoE(Mamba-2 + MoE + Attention 混合)架构与 MTP 加速,开放权重、训练数据与配方。旗舰为 Nemotron 3 Ultra 550B-A55B(2026-06-04),另有 Super 120B-A12B(2026-03-11)与 Nano 30B-A3B。面向企业私有化推理与 Agent 工作流设计,支持英、法、西、意、德、日、韩、印地、葡、中十种语言。

参数速览

项目说明
输入模态文本(多语言)
输出能力文本、工具调用、Agent 推理轨迹
推理模式可配置 enable_thinking(思考开/关)
典型模型名nvidia/nemotron-3-ultranvidia/nemotron-3-super
上下文窗口最高 1M tokens
许可OpenMDW-1.1 类开放许可

常用请求参数

参数说明
temperature / top_p采样控制
max_tokens最大输出长度
extra_body.chat_template_kwargs.enable_thinking开启/关闭思考模式
force_nonempty_contentcoding agent 建议设为 true,避免空回复

调用与兼容性

OpenAI 兼容接口,支持 vLLM、SGLang、Ollama、llama.cpp、TensorRT-LLM 部署,也可通过 NVIDIA NIM 微服务一键启动:

# NIM 示例(OpenAI 兼容)
curl https://integrate.api.nvidia.com/v1/chat/completions \
  -H "Authorization: Bearer $NGC_API_KEY" \
  -d '{"model":"nvidia/nemotron-3-ultra","messages":[{"role":"user","content":"解释 MoE 架构"}],"extra_body":{"chat_template_kwargs":{"enable_thinking":false}}}'

版本与更新注意

Nemotron 3 系列为 2026 年最新家族;Ultra 550B-A55B 推理建议 4x GB200/B200 级 GPU。家族持续迭代,关注 NVIDIA 开发者博客获取新版本。

选型建议

GPU 资源充足的企业私有化 Agent 场景选 Ultra;高频长上下文业务选 Super;边缘与轻量场景用 Nano。模型自托管可避免按 token 计费。

常见问题

NVIDIA Nemotron 是免费的吗?
NVIDIA Nemotron 的具体收费以官方定价为准,通常提供免费额度或试用期,付费后可解锁完整功能。
NVIDIA Nemotron 需要注册或登录才能使用吗?
大多数 AI 工具需要注册账号才能使用,部分支持邮箱或第三方账号快捷登录,具体以官网流程为准。
NVIDIA Nemotron 支持中文吗?
是否支持中文界面或中文回答,以该工具的官方文档与产品版本为准,建议直接在官网确认。
在哪里可以获取 NVIDIA Nemotron 的官方信息?
可以访问 NVIDIA Nemotron 官网(https://developer.nvidia.com/nemotron)查看功能、定价与最新更新信息。