NVIDIA 用数字孪生与 AI Agent 验证 AI 工厂变更
NVIDIA 提出用数字孪生与 AI Agent 验证 AI 工厂的基础设施、软件与策略变更。AI 工厂由 GPU、CPU、交换机、DPU、SuperNIC 以及调度器、编排服务、安全控制和快速变化的软件栈组成,部署与验证其协同工作均具挑战。
NVIDIA 提出用数字孪生与 AI Agent 验证 AI 工厂的基础设施、软件与策略变更。AI 工厂由 GPU、CPU、交换机、DPU、SuperNIC 以及调度器、编排服务、安全控制和快速变化的软件栈组成,部署与验证其协同工作均具挑战。
NVIDIA DOCA GPUNetIO 将网络与数据搬运统一为 GPU 直接控制的一等操作,减少 CPU 在每个网络事务中的介入。CPU 位于关键路径会增加时延并限制分布式应用的实时响应效率,GPUNetIO 旨在消除这一瓶颈。该能力覆盖 NVIDIA 软件栈,面向需要 GPU 发起网络的分布式应用。
NVIDIA 发布 AICR v1.0,为 GPU 加速 Kubernetes 集群提供开放、稳定、可验证的配置方案。该方案针对主机内核、GPU 驱动、容器运行时、网络、存储、operator 与工作负载框架等数十个各自独立发版的组件,解决版本兼容性问题。同一配置在不同服务、GPU 代际和 Kubernetes 版本下可能静默失效,AICR 旨在让部署前后的版本冲突可追溯、可验证。
NVIDIA 推出 DOCA Agent Skills,为 AI agent 提供 NVIDIA DOCA 领域知识,帮助开发者在 NVIDIA BlueField 上更快构建应用。通用 agent 缺乏 DOCA 等基础设施软件的专业知识时容易靠猜测出错,每次修正都会拖慢部署。该技能面向基础设施开发流程,减少试错成本。
NVIDIA 推出开源 C++ 样例集 Do Inference Now (DIN) Deploy,将 ONNX Runtime 与 NVIDIA TensorRT RTX 执行提供程序结合,帮助开发者从模型 checkpoint 走到本地原生应用。该样例集面向本地应用集成 AI 模型,提供可移植模型格式、可靠运行时与跨目标系统的加速支持。
NVIDIA 发布 cuObject 与 NVIDIA SCADA Server SDK,为 AI 基础设施工程师、存储开发者和云服务商提供对大容量文件与对象存储的快速、安全访问。该方案面向训练、微调、推理上下文、工具调用、搜索和数据库查询等 AI 工作负载的高速数据访问需求,覆盖本地与云端存储的数据。
NVIDIA NeMo Relay 可追踪 Agent Harness 的执行路径,暴露任务完成背后的低效行为。失败搜索触发重复搜索、截断的文件读取导致命令重复抓取同一内容等冗余步骤会增加时延并消耗 token,即使最终答案正确也会被掩盖。这些低效还带来更多失败机会,追踪能力为改进 Agent 行为提供依据。