1. NVIDIA Agent Toolkits 简介
NVIDIA Agent Toolkit是 NVIDIA 于2026 年 3 月 16 日在 GTC 2026上正式发布的一套开源企业级 AI Agent 开发平台。它并非单一产品,而是一个覆盖开发、编排、安全、部署全生命周期的模块化软件栈,旨在解决企业从 Agent 原型到生产级自主系统之间的基础设施鸿沟。
一、核心架构与组件
Agent Toolkit 由四个互补层级构成,每一层解决企业部署 Agent 时的特定痛点:
1. OpenShell — 安全运行时
OpenShell 是一个开源的安全沙箱运行时,为每个 Agent 提供进程级隔离环境。其核心能力包括:
- 策略驱动的安全控制:基于策略的网络访问控制、隐私护栏和数据边界管理。
- 最小权限模型:Agent 仅获得完成任务所需的最小权限。
- 隐私路由器(Privacy Router):在数据传入 LLM 前自动过滤敏感信息(PII)。
- 完整审计追踪:记录每个 Agent 的每一步操作,满足合规要求。
安全合作伙伴包括 Cisco、CrowdStrike、Google Security、Microsoft Security 和 TrendAI,从底层将安全控制嵌入 Agent 架构,而非事后 bolt-on。
2. NemoClaw — 企业编排与治理层
NemoClaw 是构建在 OpenShell 之上的企业级 Agent 编排层,提供:
- 多 Agent 协调:支持多个专业 Agent 并行协作处理复杂任务。
- 状态管理:跨多步工作流跟踪 Agent 状态。
- 错误恢复:内置故障处理机制,确保 Agent 在出错时优雅降级。
- 可观测性:提供全面的日志、监控和可解释性仪表板。
3. AI-Q Blueprint — 智能研究 Agent 蓝图
AI-Q 是一个开源的 Agentic 搜索参考架构,专为复杂多步研究任务设计:
- 混合架构:由前沿大模型(如 GPT-4、Claude)负责高层编排与推理,NVIDIA 自研的 Nemotron 开源模型负责检索与分析。
- 成本优化:NVIDIA 声称该混合架构可将查询成本降低50% 以上,同时保持顶级准确率。
- 基准表现:截至发布时,AI-Q 在 DeepResearch Bench 和 DeepResearch Bench II 两个权威榜单上均排名第一。
4. Nemotron — 开源模型家族
Nemotron 是 NVIDIA 专为 Agentic 推理优化的开源权重模型家族,2026 年 GTC 上发布了 Nemotron 3:
- Nemotron 3 Super:已立即开放使用。
- Nemotron Ultra / Omni / VoiceChat:后续即将推出的变体。
- 超长上下文:Nemotron 3 支持100 万 token的上下文窗口(厂商声明),适用于需要跨长任务链累积上下文的 Agent 工作流。
5. cuOpt — GPU 加速优化库
cuOpt 是一个开源的 Agent 可调用技能库,提供 GPU 加速的组合优化算法:
- 物流路径优化(供应链、配送、现场服务)。
- 资源规划(团队分配、机器调度、云容量)。
- 工作流调度:最大化 Agent 管道的吞吐量。
二、企业合作伙伴生态
NVIDIA 在发布时即宣布了17 家大型企业合作伙伴,覆盖 ERP、CRM、安全、创意软件、半导体设计等领域:
| 合作伙伴 | 集成方向 | 预计可用时间 |
|---|---|---|
| SAP | Joule Studio + NeMo,在 S/4HANA 生态中微调领域专用模型 | 2026 Q3 |
| Salesforce | Agentforce + NIM,为 Sales/Service Cloud 提供模型无关的推理后端 | 2026 Q3 |
| CrowdStrike | Falcon 安全 Agent,自动化威胁检测与事件响应 | 2026 Q2(已 GA) |
| ServiceNow | 自主工作流自动化 | 2027 |
| Adobe、Atlassian、Siemens、Cadence、Synopsys等 | 各垂直领域深度集成 | 2026-2027 |
这一策略将 NVIDIA 定位为企业 AI Agent 的中间件层,而非单纯的硬件供应商。
三、与现有开发框架的集成
Agent Toolkit 的设计目标是补充而非替代现有 Agent 框架。如果你已经在使用 LangChain、LlamaIndex 或 CrewAI,可以通过适配器模式直接接入 OpenShell 的运行时和策略层,无需重写 Agent 逻辑。
示例代码模式:
fromnvidia_agent_toolkitimportOpenShellRuntimefromnvidia_agent_toolkit.integrationsimportLangChainAdapter runtime=OpenShellRuntime(sandbox_mode="standard")secured_agent=LangChainAdapter(agent=existing_langchain_agent,runtime=runtime,policy=EnterprisePolicy(pii_detection=True),)四、垂直领域扩展
1. 物理 AI:Omniverse 库集成
在SIGGRAPH 2026上,NVIDIA 宣布 Agent Toolkit 集成Omniverse 库,使 AI Agent 具备物理 AI 能力:
- ovrtx:RTX 传感器模拟。
- ovphysx:GPU 加速物理引擎。
- CAD 到 SimReady 转换:自动将 CAD 数据转换为仿真就绪资产。
- SimReady Blender 蓝图:开源的 Blender 集成方案。
这些库以独立的 C API(带 C++/Python 绑定)形式发布,无需完整 Omniverse 平台即可调用,使编码 Agent 能够自主检查场景、标记问题、准备资产并运行仿真。
2. 生命科学:BioNeMo Agent Toolkit
在BIO 2026(2026 年 6 月 23 日)上,NVIDIA 发布了BioNeMo Agent Toolkit,一套开源的 Agent 可调用生命科学技能库:
- 能力范围:蛋白质折叠、分子对接、生成化学、基因组分析、蛋白质设计、生物标志物发现。
- 性能基准:在 NVIDIA 的测试中,未配备这些技能的 Agent 仅完成57.1%的科学任务,而配备后达到100%。
- Agent 无关:支持 Claude、Codex 等任何 Agent 运行时。Anthropic 已将其直接集成到 Claude Science 中。
- 许可:代码以CC BY 4.0开源,NIM 托管端点免费用于原型(约 40 RPM)。
五、部署选项与性能
Agent Toolkit 针对 NVIDIA 硬件进行了协同优化,但也支持任意基础设施:
- 云端:预优化的 AWS、Azure、GCP 连接器。
- 本地数据中心:适用于安全敏感场景。
- 边缘:支持 NVIDIA Jetson,用于 IoT 和机器人。
在 NVIDIA 的基准测试中,基于 DGX 系统 + Vera CPU 的 Agent 集群,吞吐量比标准 x86 基础设施高出3.2 倍,主要得益于上下文组装和工具结果编组延迟的降低。
六、定价与许可模式
| 层级 | 费用 | 说明 |
|---|---|---|
| 开源代码 | 免费 | GitHub 开源,CC BY 4.0 许可 |
| NIM 托管端点 | 免费(原型) | build.nvidia.com,约 40 RPM 限速,无 SLA |
| 生产部署 | 付费 | 需NVIDIA AI Enterprise许可证,提供 90 天免费试用 |
| 自托管 NIM | 需 GPU 节点 | 仅在本地运行 NIM 时需要 GPU |
七、战略意义
NVIDIA Agent Toolkit 标志着 NVIDIA 从"GPU 制造商"向"完整 AI 软件平台公司"的战略转型。Jensen Huang 将其角色比喻为 AI 时代的“收费站”(tollbooth)——无论企业使用哪种模型、哪种应用,只要训练和运行 Agent,就可能在 NVIDIA 的基础设施层产生价值。
对于 CIO 而言,这意味着 2026 年已不再是观望期:SAP S/4HANA 和 Salesforce 环境的 Agent 试点预算窗口已在2026 年 Q3打开,而 Agent 架构的锁定效应将主要体现在编排层而非模型层——选择在 SAP-NVIDIA 或 Salesforce-NVIDIA 基础上构建 Agent,即意味着进入相应的生态合约。
2. 开源程度介绍以及第三方算力公司接入方式
以下从开源内容/开源程度和第三方硬件算力公司接入方式两个维度,对 NVIDIA Agent Toolkit 进行系统性说明。
一、开源内容与开源程度
1.1 许可证体系
NVIDIA Agent Toolkit 采用分层许可证策略,整体偏向宽松:
| 资产类型 | 许可证 | 关键权利 |
|---|---|---|
| 代码 | Apache License 2.0 | 商业使用、修改、分发、专利保护 |
| 文档/Skills | CC BY 4.0 或双许可 | 可自由引用、修改,需署名 |
| 模型权重 | NVIDIA Open Model License (OML) | 允许商业使用、微调、再分发;禁止对 NVIDIA 提起专利诉讼 |
1.2 开源仓库全景
所有核心组件均在 GitHub 公开维护,截至 2026 年 8 月的主要仓库包括:
| 仓库 | 功能定位 | 语言/技术 | Stars (约) |
|---|---|---|---|
NVIDIA/NeMo-Agent-Toolkit | 核心 Agent 构建工具包 | Python/TypeScript | — |
NVIDIA/OpenShell | 安全沙箱运行时(网关、策略引擎、Privacy Router) | Rust (~90%) | 7.8K+ |
NVIDIA/NemoClaw | 企业级 Agent 参考栈(Hermes、OpenClaw、Deep Agents 的运行时) | Python | 22.1K+ |
NVIDIA-AI-Blueprints/aiq | AI-Q 智能研究 Agent 蓝图 | Python | — |
NVIDIA/NeMo-Agent-Toolkit-UI | 前端 Web UI | TypeScript/Next.js | — |
NVIDIA/NeMo-Agent-Toolkit-Examples | 社区示例与教程 | Python | — |
NVIDIA/skills | Agent Skills 目录(cuOpt、Omniverse、RAG 等) | 多语言 | — |
NVIDIA/OpenShell-Community | 社区沙箱镜像与配置 | Docker/YAML | — |
1.3 开源程度评估
高度开源的方面:
- 代码完全开放:OpenShell 约 90% 为 Rust 代码,NemoClaw 为 Python,均可自由 fork、修改、提交 PR。
- 社区活跃:OpenShell 在 2026 年 2 月创建仓库后,截至 6 月已有 66 位贡献者、53 个 release、842 个 fork,保持近每日发布的节奏。
- 模型权重开放:Nemotron 3 系列(Nano、Super、Ultra、Embed 等)均在 Hugging Face 和 ModelScope 提供完整权重下载,包括 BF16 和 NVFP4 量化版本。
- 第三方集成友好:官方明确支持与 LangChain、LlamaIndex、CrewAI 等现有开源框架集成,无需重写 Agent 逻辑。
存在商业限制的方面:
- NIM 微服务:自托管 NVIDIA NIM 推理微服务需要 NVIDIA GPU 硬件,且生产部署需购买NVIDIA AI Enterprise许可证。
- 免费托管端点:build.nvidia.com 提供免费 NIM 端点,但限制约40 RPM、无 SLA,仅适合原型验证。
- 硬件优化锁定:cuOpt、TensorRT-LLM、NVFP4 量化格式等核心加速技术仅针对 NVIDIA CUDA/Blackwell 架构优化。
二、第三方硬件算力公司接入生态的方式
NVIDIA Agent Toolkit 的架构设计有一个关键特性:Agent 运行时(OpenShell)与推理后端解耦。这意味着第三方硬件公司不需要修改 OpenShell 内核,只需提供兼容的推理服务端点即可接入。
2.1 架构解耦原理
OpenShell 通过两条路径处理推理流量:
| 路径 | 机制 | 第三方硬件适用性 |
|---|---|---|
inference.local | 沙箱内代码调用此内部端点,OpenShell 网关的 Privacy Router 拦截请求,注入真实凭证后转发到配置的 Provider | 核心接入点— 可指向任何外部推理服务 |
| 外部端点 | 沙箱内代码直接访问外部 API,受network_policies管控 | 适用于云 API 或局域网内的第三方推理服务 |
2.2 按硬件平台的接入路径
A. AMD GPU(ROCm 生态)
可行路径:Ollama / vLLM + compatible-endpoint
- Ollama 路径:Ollama 原生支持 AMD GPU(通过 ROCm v7 on Linux / HIP7 on Windows)。在 AMD 主机上安装 Ollama 并加载模型后,通过以下命令将其注册为 OpenShell 的推理后端:
openshell provider create\--nameollama-amd\--typeopenai\--credentialOPENAI_API_KEY=ollama\--configOPENAI_BASE_URL=http://host.openshell.internal:11434/v1 openshell inferenceset--providerollama-amd--modelllama3.2- vLLM 路径:vLLM 从 0.6.6+ 开始支持 AMD ROCm 6.3+。在 AMD GPU 节点启动 vLLM 服务后,同样通过
compatible-endpoint接入。
实际验证案例:GitHub Issue 显示,开发者在 AMD Ryzen AI 9 HX 370(Radeon 890M iGPU,32GB 共享显存)上成功运行 NemoClaw + Ollama,通过compatible-endpoint完成推理。
注意事项:
- NemoClaw 官方安装程序默认检测 NVIDIA driver 550+ 和 CUDA 12.4+,在纯 AMD 环境需跳过 GPU 检测或手动配置。
- GPU passthrough 到 sandbox pods 需要 NVIDIA Container Toolkit,AMD 环境无法使用此特性,但 CPU 沙箱 + 外部 AMD 推理服务完全可行。
B. Intel XPU / GPU
可行路径:vLLM / GPTQModel + compatible-endpoint
- vLLM 已添加 Intel XPU 后端支持,可在 Intel Data Center GPU Flex 系列或 Arc 显卡上运行。
- GPTQModel 等量化工具也已支持 Intel XPU。
- 通过自托管 Intel 推理服务,以 OpenAI-compatible API 形式暴露端点,再用
compatible-endpoint接入 OpenShell。
限制:无原生 Intel GPU 加速的 Nemotron 权重格式,需通过 vLLM 的通用路径加载。
C. Apple Silicon(M1/M2/M3/M4/M5)
官方支持状态:OpenShell 明确支持 macOS Apple Silicon (arm64) via Docker Desktop。
- 网关与沙箱:可完整运行 OpenShell 网关、策略引擎和沙箱隔离。
- 推理路径:由于 Apple Silicon 无 NVIDIA GPU,本地推理需通过:
- 云端 NIM:使用 NVIDIA Cloud 端点(自动配置)。
- 本地 Ollama CPU 模式:Ollama 在 Apple Silicon 上运行,但受限于内存和 CPU 性能。
- 外部推理服务:通过
network_policies允许访问局域网或远程 GPU 节点。
实际案例:M5 Max MacBook Pro 上成功运行 NemoClaw,安全模型和策略完全生效,使用 NVIDIA Cloud NIM 进行推理。
已知问题:本地 Ollama 在 macOS 上存在inference.localDNS 解析 bug,需手动配置/etc/hosts或使用 host 网络模式。
D. 华为昇腾(Ascend NPU)
社区路径:vLLM-Ascend + compatible-endpoint
- vLLM-Ascend:社区项目正在添加 Nemotron 3 Super 的昇腾支持,通过 CANN 后端实现。
- GPTQModel:已官方添加 Huawei Ascend NPU 支持,可用于模型量化与推理。
- 接入方式:在昇腾节点部署 vLLM-Ascend 或 MindIE 推理服务,暴露 OpenAI-compatible API,通过
compatible-endpoint接入 OpenShell。
限制:
- Nemotron 3 的 NVFP4 量化格式仅 NVIDIA Blackwell 原生支持,昇腾需使用 BF16 或 FP16 版本。
- 无官方 NVIDIA 优化,性能取决于社区适配成熟度。
E. 纯 CPU / 云 API / 任意算力
最通用的接入方式:
OpenShell 本身可在纯 CPU 节点运行,不依赖任何 GPU。通过network_policies允许沙箱访问外部推理端点:
# policy.yamlnetwork:allowed_egress:-host:"your-inference-cluster.internal"port:8000-host:"api.openai.com"port:443这意味着:
- 云端 GPU 集群(如 AWS Inferentia、Google TPU、Intel Gaudi)可通过标准 REST API 接入。
- 自研 ASIC(如 Google TPU、Amazon Trainium)只需实现 OpenAI-compatible API 即可被 OpenShell 调用。
- CPU 推理(如 llama.cpp、Ollama CPU 模式)完全支持。
2.3 第三方硬件接入的核心限制
尽管架构上支持解耦,但以下能力严格绑定 NVIDIA 硬件:
| 能力 | 绑定原因 | 第三方硬件替代方案 |
|---|---|---|
| cuOpt Agent Skills | GPU 加速的组合优化库,CUDA 专用 | 使用纯 CPU 求解器(如 OR-Tools)或自研技能 |
| TensorRT-LLM 推理 | NVIDIA 专有推理引擎 | 使用 vLLM、SGLang、llama.cpp 等跨平台引擎 |
| NVFP4/MXFP4 量化 | 仅 Blackwell 架构原生支持 | 使用 BF16/FP16/INT8 格式,或 GGUF/Q4_K_M |
| NIM 微服务 | 仅支持 NVIDIA GPU | 使用自托管 vLLM/Ollama 替代 |
| GPU Passthrough 到沙箱 | 需要 NVIDIA Container Toolkit + CDI | 使用 CPU 沙箱 + 外部推理服务 |
2.4 对第三方硬件厂商的建议接入策略
如果你是AMD、Intel、华为昇腾、Google TPU等硬件厂商,或基于这些硬件的云服务商,建议按以下优先级接入:
最低成本验证(PoC 阶段):
- 在目标硬件上部署Ollama或vLLM,加载 Nemotron 3 或 Llama 等开源模型。
- 通过
compatible-endpoint模式接入 NemoClaw/OpenShell,验证端到端 Agent 工作流。
性能优化(生产阶段):
- 针对自家硬件优化 vLLM 后端(如 AMD ROCm、Intel XPU、华为 CANN)。
- 提供预置的模型量化方案(如 GGUF、FP16、BF16),替代 NVFP4。
- 与 NVIDIA 合作将硬件加入 NemoClaw 的managed install白名单(如 DGX Spark 的自动检测逻辑)。
生态深度集成(长期):
- 为 OpenShell-Community 仓库贡献沙箱镜像(如
sandbox-amd-rocm、sandbox-ascend)。 - 在 NVIDIA/skills 仓库中提交针对自家硬件优化的 Agent Skills(如
amd-mi300-inference、intel-xpu-embed)。
- 为 OpenShell-Community 仓库贡献沙箱镜像(如
三、总结
| 维度 | 实际情况 |
|---|---|
| 开源程度 | 代码完全开源(Apache 2.0),模型权重开放(OML),社区活跃;但生产级 NIM 和硬件加速库有商业/硬件绑定。 |
| 第三方硬件接入可行性 | 高。通过inference.local+compatible-endpoint架构,任何支持 OpenAI-compatible API 的推理后端均可接入。 |
| 接入最佳实践 | AMD/Intel/昇腾/Apple Silicon 均已有验证路径;核心限制在于 NVIDIA 专有加速库(cuOpt、TensorRT-LLM、NVFP4),需用跨平台替代方案。 |
| 厂商策略建议 | 优先以 vLLM/Ollama 提供兼容端点,再逐步优化硬件原生后端,最后通过社区贡献实现深度生态集成。 |
NVIDIA Agent Toolkit 的设计哲学是“Agent 运行时开放,推理后端可插拔”。这意味着第三方硬件厂商无需获得 NVIDIA 的授权或修改内核代码,只需提供标准的 OpenAI-compatible 推理服务,即可让 Agent 生态运行在自己的算力之上。
3. 开源网址汇总
以下是 NVIDIA Agent Toolkit 生态中所有主要开源项目的源代码网址汇总,按功能模块分类整理:
一、核心 Agent 构建工具包
| 项目名称 | 功能描述 | 源代码地址 |
|---|---|---|
| NeMo Agent Toolkit | 核心开源库,用于连接和优化 AI Agent 团队,支持多框架集成(LangChain、LlamaIndex、AutoGen、ADK 等) | github.com/NVIDIA/NeMo-Agent-Toolkit |
| NeMo Agent Toolkit UI | 官方 Web 前端界面,支持实时流式响应、人机协同工作流、明暗主题 | github.com/NVIDIA/NeMo-Agent-Toolkit-UI |
| NeMo Agent Toolkit Examples | 社区驱动的示例仓库,包含真实场景用例和教程 | github.com/NVIDIA/NeMo-Agent-Toolkit-Examples |
二、安全运行时与沙箱
| 项目名称 | 功能描述 | 源代码地址 |
|---|---|---|
| OpenShell | 安全沙箱运行时,提供进程隔离、Landlock/seccomp 策略执行、网络命名空间隔离、Privacy Router 推理路由 | github.com/NVIDIA/OpenShell |
| OpenShell Community | 社区维护的沙箱镜像和配置,包含基础沙箱定义 | github.com/NVIDIA/OpenShell-Community |
三、企业级 Agent 参考栈
| 项目名称 | 功能描述 | 源代码地址 |
|---|---|---|
| NemoClaw | 企业级参考栈,在 OpenShell 上运行 OpenClaw/Hermes/LangChain Deep Agents,提供引导式安装、托管推理、网络策略和生命周期管理 | github.com/NVIDIA/NemoClaw |
| NemoClaw OpenShift | 社区适配的 OpenShift 部署版本 | github.com/rh-ai-quickstart/NemoClaw-OpenShift |
四、Agent Skills 与蓝图
| 项目名称 | 功能描述 | 源代码地址 |
|---|---|---|
| NVIDIA Skills | 官方 Agent Skills 目录(cuOpt、Omniverse、RAG、CUDA、物理 AI 等),支持 Claude Code / Codex 插件安装 | github.com/nvidia/skills |
| BioNeMo Agent Toolkit | 生命科学专用 Skills 库(蛋白质折叠、分子对接、生成化学、基因组分析等) | github.com/NVIDIA-BioNeMo/bionemo-agent-toolkit |
| AI-Q Blueprint | 智能研究 Agent 参考架构,混合大模型编排 + Nemotron 检索分析 | github.com/NVIDIA-AI-Blueprints/aiq |
五、优化引擎与模型
| 项目名称 | 功能描述 | 源代码地址 |
|---|---|---|
| cuOpt | GPU 加速决策优化引擎(LP、QP、VRP、MIP),支持 Agent 技能调用 | github.com/nvidia/cuopt |
| Nemotron 3 模型权重 | 开源模型家族(Nano、Super、Ultra、Embed 等),Hugging Face 托管 | huggingface.co/nvidia |
六、相关依赖与生态项目
| 项目名称 | 功能描述 | 源代码地址 |
|---|---|---|
| NVIDIA Dynamo | 推理加速框架(与 NeMo Agent Toolkit 集成用于端到端加速) | github.com/ai-dynamo/dynamo |
七、官方文档
| 文档站点 | 说明 | 地址 |
|---|---|---|
| OpenShell 官方文档 | 开发者指南、API 参考、策略配置 | docs.nvidia.com/openshell |
| NemoClaw 官方文档 | 架构、安装、安全最佳实践、CLI 参考 | nvidia.github.io/NemoClaw |
| NVIDIA 开发者博客 | cuOpt Agent Skills、NVFP4 量化等技术文章 | developer.nvidia.com/blog |
许可证说明:上述官方仓库中,源代码普遍采用Apache License 2.0,Skills 文档采用CC BY 4.0,Nemotron 模型权重采用NVIDIA Open Model License(允许商业使用)。