NVIDIA 发布 Nemotron 3 Nano Omni,统一视觉、音频和语言 Agent 能力

NVIDIA 推出 Nemotron 3 Nano Omni,强调视觉、音频和语言统一后能让 AI Agent 更高效处理多模态任务。

浏览 13
NVIDIA 发布 Nemotron 3 Nano Omni,统一视觉、音频和语言 Agent 能力封面

NVIDIA Nemotron 3 Nano Omni:把视觉、音频和语言合并到一个多模态 Agent 模型

NVIDIA 在 2026 年 4 月 28 日发布 Nemotron 3 Nano Omni,将其描述为开放的 omni-modal reasoning model。按照 NVIDIA 的说明,这个模型把视觉、音频和语言能力整合到一个系统中,让 Agent 可以在 video、audio、image 和 text 上做高级推理。

这次发布的重点不是再增加一个单独的视觉模型或语音模型,而是解决当前 Agent 系统常见的多模型拼接问题。NVIDIA 在原文中指出,今天很多 AI agent systems 需要分别使用视觉、语音和语言模型,不同模型之间传递数据会损失时间和上下文。

一个模型承担“眼睛和耳朵”角色

NVIDIA 在 “At a Glance” 中把 Nemotron 3 Nano Omni 定义为面向 agentic systems 的 multimodal perception sub-agent。它可以处理文本、图像、音频、视频、文档、图表和图形界面输入,并输出文本。

NVIDIA 对它的角色描述很清楚:它不是取代所有 Agent 模型,而是作为系统中的“eyes and ears”,与 Nemotron 3 Super、Nemotron 3 Ultra 或其他专有模型一起工作。

这意味着它更适合在多 Agent 或分层 Agent 系统中承担感知层任务。例如,一个更强的规划模型可以负责决策,而 Nemotron 3 Nano Omni 负责快速理解屏幕、文档、音频和视频中的信息。

30B-A3B 混合 MoE 架构和 256K 上下文

原文给出了模型架构信息:Nemotron 3 Nano Omni 使用 30B-A3B hybrid MoE,结合 Conv3D、EVS,并支持 256K context。NVIDIA 还称,它是同类开放多模态模型中最高效率的模型之一,具备领先准确率。

NVIDIA 强调的核心指标是效率。该模型在保持同等交互性的前提下,相比其他开放 omni models 可实现 9 倍更高 throughput,从而降低成本、提升可扩展性,并保持响应性。

对 Agent 系统来说,效率很关键。多模态 Agent 经常需要反复读取屏幕、文档、图表、音频和视频。如果感知模型太慢,整个 Agent 循环就会变慢;如果每种模态都用独立模型,成本和上下文碎片化也会增加。

目标场景包括电脑使用、文档智能和音视频推理

NVIDIA 原文列出三个主要使用方向:computer use agents、document intelligence、audio and video understanding。

在 computer use 场景中,Nemotron 3 Nano Omni 可以为 Agent 提供感知循环,帮助它理解图形界面、屏幕内容和 UI 状态随时间的变化。H Company 的 computer usage agent 使用该模型处理 1920×1080 原生分辨率输入,用于高保真视觉推理。

在 document intelligence 场景中,模型可以解释文档、图表、表格、截图和混合媒体输入,让 Agent 同时理解视觉结构和文本内容。在 audio and video understanding 场景中,它可以在客户服务、研究和监控工作流中维持音视频上下文,把“说了什么”“展示了什么”“文档记录了什么”连接到同一个推理流里。

开放权重和部署灵活性是另一个重点

NVIDIA 表示,Nemotron 3 Nano Omni 提供 open weights、datasets 和 training techniques,让组织可以透明地定制和部署模型。开发者可以使用 NVIDIA NeMo 进行定制、评估和优化。

模型已在 2026 年 4 月 28 日通过 Hugging Face、OpenRouter、build.nvidia.com 和 25 个以上合作伙伴平台开放。NVIDIA 还提到,AI 和软件公司如 Aible、ASI、Eka Care、Foxconn、H Company、Palantir、Pyler 等已采用该模型,Dell Technologies、Docusign、Infosys、K-Dense、Lila、Oracle 和 Zefr 等正在评估。

部署位置也覆盖本地系统、NVIDIA Jetson、DGX Spark、DGX Station、数据中心和云环境。这说明 Nemotron 3 Nano Omni 的目标不是只跑在云端,而是覆盖从边缘到企业数据中心的多模态 Agent 感知需求。

这次发布的实际看点

Nemotron 3 Nano Omni 的实际看点,是 NVIDIA 正在为 Agent 系统拆出一个专门的多模态感知层。它不强调自己替代所有大模型,而是作为 Agent 系统中的 perception sub-agent,解决屏幕、文档、音频、视频和图形界面理解问题。

这对企业 Agent 很现实。客服、金融分析、合规审查、电脑使用、视频监控和文档处理都不是单一文本任务。如果模型能用统一上下文处理多种输入,就能减少系统拼接成本,也降低多模型传递造成的延迟和信息丢失。

参考来源

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

13