NVIDIA 发布 Nemotron 3 Nano Omni,统一视觉、音频和语言 Agent 能力
NVIDIA 推出 Nemotron 3 Nano Omni,强调视觉、音频和语言统一后能让 AI Agent 更高效处理多模态任务。
NVIDIA Nemotron 3 Nano Omni:把视觉、音频和语言合并到一个多模态 Agent 模型
NVIDIA 在 2026 年 4 月 28 日发布 Nemotron 3 Nano Omni,将其描述为开放的 omni-modal reasoning model。按照 NVIDIA 的说明,这个模型把视觉、音频和语言能力整合到一个系统中,让 Agent 可以在 video、audio、image 和 text 上做高级推理。
这次发布的重点不是再增加一个单独的视觉模型或语音模型,而是解决当前 Agent 系统常见的多模型拼接问题。NVIDIA 在原文中指出,今天很多 AI agent systems 需要分别使用视觉、语音和语言模型,不同模型之间传递数据会损失时间和上下文。
一个模型承担“眼睛和耳朵”角色
NVIDIA 在 “At a Glance” 中把 Nemotron 3 Nano Omni 定义为面向 agentic systems 的 multimodal perception sub-agent。它可以处理文本、图像、音频、视频、文档、图表和图形界面输入,并输出文本。
NVIDIA 对它的角色描述很清楚:它不是取代所有 Agent 模型,而是作为系统中的“eyes and ears”,与 Nemotron 3 Super、Nemotron 3 Ultra 或其他专有模型一起工作。
这意味着它更适合在多 Agent 或分层 Agent 系统中承担感知层任务。例如,一个更强的规划模型可以负责决策,而 Nemotron 3 Nano Omni 负责快速理解屏幕、文档、音频和视频中的信息。
30B-A3B 混合 MoE 架构和 256K 上下文
原文给出了模型架构信息:Nemotron 3 Nano Omni 使用 30B-A3B hybrid MoE,结合 Conv3D、EVS,并支持 256K context。NVIDIA 还称,它是同类开放多模态模型中最高效率的模型之一,具备领先准确率。
NVIDIA 强调的核心指标是效率。该模型在保持同等交互性的前提下,相比其他开放 omni models 可实现 9 倍更高 throughput,从而降低成本、提升可扩展性,并保持响应性。
对 Agent 系统来说,效率很关键。多模态 Agent 经常需要反复读取屏幕、文档、图表、音频和视频。如果感知模型太慢,整个 Agent 循环就会变慢;如果每种模态都用独立模型,成本和上下文碎片化也会增加。
目标场景包括电脑使用、文档智能和音视频推理
NVIDIA 原文列出三个主要使用方向:computer use agents、document intelligence、audio and video understanding。
在 computer use 场景中,Nemotron 3 Nano Omni 可以为 Agent 提供感知循环,帮助它理解图形界面、屏幕内容和 UI 状态随时间的变化。H Company 的 computer usage agent 使用该模型处理 1920×1080 原生分辨率输入,用于高保真视觉推理。
在 document intelligence 场景中,模型可以解释文档、图表、表格、截图和混合媒体输入,让 Agent 同时理解视觉结构和文本内容。在 audio and video understanding 场景中,它可以在客户服务、研究和监控工作流中维持音视频上下文,把“说了什么”“展示了什么”“文档记录了什么”连接到同一个推理流里。
开放权重和部署灵活性是另一个重点
NVIDIA 表示,Nemotron 3 Nano Omni 提供 open weights、datasets 和 training techniques,让组织可以透明地定制和部署模型。开发者可以使用 NVIDIA NeMo 进行定制、评估和优化。
模型已在 2026 年 4 月 28 日通过 Hugging Face、OpenRouter、build.nvidia.com 和 25 个以上合作伙伴平台开放。NVIDIA 还提到,AI 和软件公司如 Aible、ASI、Eka Care、Foxconn、H Company、Palantir、Pyler 等已采用该模型,Dell Technologies、Docusign、Infosys、K-Dense、Lila、Oracle 和 Zefr 等正在评估。
部署位置也覆盖本地系统、NVIDIA Jetson、DGX Spark、DGX Station、数据中心和云环境。这说明 Nemotron 3 Nano Omni 的目标不是只跑在云端,而是覆盖从边缘到企业数据中心的多模态 Agent 感知需求。
这次发布的实际看点
Nemotron 3 Nano Omni 的实际看点,是 NVIDIA 正在为 Agent 系统拆出一个专门的多模态感知层。它不强调自己替代所有大模型,而是作为 Agent 系统中的 perception sub-agent,解决屏幕、文档、音频、视频和图形界面理解问题。
这对企业 Agent 很现实。客服、金融分析、合规审查、电脑使用、视频监控和文档处理都不是单一文本任务。如果模型能用统一上下文处理多种输入,就能减少系统拼接成本,也降低多模型传递造成的延迟和信息丢失。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。