NVIDIA 发布 Nemotron 3 Nano Omni,统一视觉、音频和语言 Agent 能力
NVIDIA 推出 Nemotron 3 Nano Omni,强调视觉、音频和语言统一后能让 AI Agent 更高效处理多模态任务。
NVIDIA Nemotron 3 Nano Omni:把视觉、音频和语言合并到一个多模态 Agent 模型
NVIDIA 在 2026 年 4 月 28 日发布 Nemotron 3 Nano Omni,将其描述为开放的 omni-modal reasoning model。按照 NVIDIA 的说明,这个模型把视觉、音频和语言能力整合到一个系统中,让 Agent 可以在 video、audio、image 和 text 上做高级推理。
这次发布的重点不是再增加一个单独的视觉模型或语音模型,而是解决当前 Agent 系统常见的多模型拼接问题。NVIDIA 在原文中指出,今天很多 AI agent systems 需要分别使用视觉、语音和语言模型,不同模型之间传递数据会损失时间和上下文。
一个模型承担“眼睛和耳朵”角色
NVIDIA 在 “At a Glance” 中把 Nemotron 3 Nano Omni 定义为面向 agentic systems 的 multimodal perception sub-agent。它可以处理文本、图像、音频、视频、文档、图表和图形界面输入,并输出文本。
NVIDIA 对它的角色描述很清楚:它不是取代所有 Agent 模型,而是作为系统中的“eyes and ears”,与 Nemotron 3 Super、Nemotron 3 Ultra 或其他专有模型一起工作。
这意味着它更适合在多 Agent 或分层 Agent 系统中承担感知层任务。例如,一个更强的规划模型可以负责决策,而 Nemotron 3 Nano Omni 负责快速理解屏幕、文档、音频和视频中的信息。
30B-A3B 混合 MoE 架构和 256K 上下文
原文给出了模型架构信息:Nemotron 3 Nano Omni 使用 30B-A3B hybrid MoE,结合 Conv3D、EVS,并支持 256K context。NVIDIA 还称,它是同类开放多模态模型中最高效率的模型之一,具备领先准确率。
NVIDIA 强调的核心指标是效率。该模型在保持同等交互性的前提下,相比其他开放 omni models 可实现 9 倍更高 throughput,从而降低成本、提升可扩展性,并保持响应性。
对 Agent 系统来说,效率很关键。多模态 Agent 经常需要反复读取屏幕、文档、图表、音频和视频。如果感知模型太慢,整个 Agent 循环就会变慢;如果每种模态都用独立模型,成本和上下文碎片化也会增加。
目标场景包括电脑使用、文档智能和音视频推理
NVIDIA 原文列出三个主要使用方向:computer use agents、document intelligence、audio and video understanding。
在 computer use 场景中,Nemotron 3 Nano Omni 可以为 Agent 提供感知循环,帮助它理解图形界面、屏幕内容和 UI 状态随时间的变化。H Company 的 computer usage agent 使用该模型处理 1920×1080 原生分辨率输入,用于高保真视觉推理。
在 document intelligence 场景中,模型可以解释文档、图表、表格、截图和混合媒体输入,让 Agent 同时理解视觉结构和文本内容。在 audio and video understanding 场景中,它可以在客户服务、研究和监控工作流中维持音视频上下文,把“说了什么”“展示了什么”“文档记录了什么”连接到同一个推理流里。
开放权重和部署灵活性是另一个重点
NVIDIA 表示,Nemotron 3 Nano Omni 提供 open weights、datasets 和 training techniques,让组织可以透明地定制和部署模型。开发者可以使用 NVIDIA NeMo 进行定制、评估和优化。
模型已在 2026 年 4 月 28 日通过 Hugging Face、OpenRouter、build.nvidia.com 和 25 个以上合作伙伴平台开放。NVIDIA 还提到,AI 和软件公司如 Aible、ASI、Eka Care、Foxconn、H Company、Palantir、Pyler 等已采用该模型,Dell Technologies、Docusign、Infosys、K-Dense、Lila、Oracle 和 Zefr 等正在评估。
部署位置也覆盖本地系统、NVIDIA Jetson、DGX Spark、DGX Station、数据中心和云环境。这说明 Nemotron 3 Nano Omni 的目标不是只跑在云端,而是覆盖从边缘到企业数据中心的多模态 Agent 感知需求。
这次发布的实际看点
Nemotron 3 Nano Omni 的实际看点,是 NVIDIA 正在为 Agent 系统拆出一个专门的多模态感知层。它不强调自己替代所有大模型,而是作为 Agent 系统中的 perception sub-agent,解决屏幕、文档、音频、视频和图形界面理解问题。
这对企业 Agent 很现实。客服、金融分析、合规审查、电脑使用、视频监控和文档处理都不是单一文本任务。如果模型能用统一上下文处理多种输入,就能减少系统拼接成本,也降低多模型传递造成的延迟和信息丢失。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
17GB对100GB:Qwen3.8-27B与Flash-Next做同一批任务,省下的容量换来了什么?
同做89项终端任务,17GB的27B首轮完成35项,100GB的Flash-Next完成45项;最多两次是46对53,最多四次是48对60。本文追到9月13日后续结果,区分模型能力、环境故障和返工时间;测试为苹果MLX四位量化,不是GSQ-RCO IQ3_S,也不能套到16GB显卡。
Qwen3.8-Flash-Next每秒70词元?本地加速之前,先看模型究竟改了什么
同样叫Flash-Next,70词元/秒背后可能是另一条计算路径:每词元激活专家从10减到5,再训练共享专家补偿。本文对照单台DGX Spark的两套原始资料,拆开量化、MTP、输入速度、输出速度和并发吞吐,不把128GB统一内存结果套到16GB显卡。
NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化”
可以把 NVIDIA PAIR 理解成家里本地 AI 的“派单前台”:RTX 主机、DGX Spark、Mac 就像几名能力不同的员工,PAIR 看谁在线、谁装了对应模型、谁现在最空闲,就把下一份 AI 工作交给谁。它特别适合多 Agent 并发,但不会把 16GB + 24GB 显存拼成 40GB,也不会把一个大模型拆到多台机器上。