NVIDIA 推动 RTX PC 和 DGX Spark 上的本地 AI Agent
NVIDIA 介绍本地 AI Agent 在 RTX PC 和 DGX Spark 上的能力升级,强调个人代理和开源项目的增长。
NVIDIA 推动 RTX PC 和 DGX Spark 上的本地 Agent:隐私、安全和性能成为核心卖点
NVIDIA 在 2026 年 5 月 31 日发布文章,介绍 RTX PC 与 DGX Spark 上的本地 AI Agent 更新。按照 NVIDIA 的说法,个人 Agent 正在快速流行,OpenClaw、Hermes 等开源项目在 GitHub 开发者社区中快速采用。这类 Agent 可以适配用户偏好和工作流,在本地设备上与应用交互、生成内容、自动化重复流程,并管理多步骤任务。
NVIDIA 在 COMPUTEX 的 GTC Taipei 期间推出 RTX Spark,并同步介绍 OpenShell、NemoClaw、local open model 优化、H Company 电脑使用工具,以及 Adobe、Blender、ComfyUI 等创作软件更新。整体方向很明确:让本地设备不只是运行模型,而是运行可持续工作的 Agent。
本地 Agent 的前提是安全和隐私
NVIDIA 文章指出,Agent 广泛采用的限制之一,是无法在用户主力 PC 上安全、私密地运行。为此,NVIDIA 与 Microsoft 合作,围绕 Windows 上的 on-device agents 构建更安全的平台。
文章提到,新的 Windows security primitives 提供 identity、containment、policy 和 end-to-end security 能力;NVIDIA OpenShell runtime 则提供额外 policy 能力,让用户定义 Agent 可以做什么、不能做什么,还可以根据隐私策略把请求智能路由到本地模型,并对发送给云模型的查询隐藏个人信息。
Hermes Agent 和 OpenClaw 将在新的 Windows 应用中集成 OpenShell 和 Microsoft security primitives。这说明本地 Agent 的发展不只是硬件问题,权限、策略和隐私控制同样是产品能否被用户接受的前提。
RTX Spark 面向个人 Agent 计算需求
NVIDIA 将 RTX Spark 描述为一类面向 personal agents 的 Windows PC。文章称,RTX Spark 拥有 1 petaflop AI compute 和 128GB unified memory,可以满足 on-device agents 的计算需求,让电脑从工具走向 teammate。
这个定位和普通 AI PC 不完全一样。普通 AI PC 可能只强调本地运行小模型、提升图像或视频处理效率;RTX Spark 面向的是更持续的 Agent 工作流:在本地理解应用、执行跨应用任务、搜索文件、生成图像和视频、甚至编写插件和应用。
NVIDIA 同时介绍 DGX Station for Windows,称其是面向专业用户的 AI deskside supercomputer,配备数据中心级 GPU 和 CPU,同时具备 Windows 的可管理性、安全性和兼容性。
开源模型和推理优化决定本地体验
本地 Agent 要真正可用,模型不能太慢。NVIDIA 文章提到,NVIDIA 与 llama.cpp 社区合作,通过 multi-token prediction 等优化,让 Qwen 3.6 和 3.5 27B 在 NVIDIA GPU 上获得最高 2 倍性能,35B 模型获得 1.6 倍性能提升。
多 GPU 用户也获得了额外优化:llama.cpp 增加 tensor parallelism,双等效 GPU 下可获得最高 2 倍内存和 1.8 倍计算;ComfyUI 也增加了多 GPU 技术,用于提升生成效率和利用组合显存。
这说明本地 Agent 的体验并不只取决于单个模型大小,而取决于硬件、运行时、推理框架和优化技术能否形成完整链条。Agent 需要多步骤思考、工具调用和持续运行,延迟和吞吐都会直接影响可用性。
OpenShell、NemoClaw 和 H Company 补齐执行层
NVIDIA 文章还介绍了多个 Agent 执行层更新。OpenShell 即将登陆 Windows,为安全本地 Agent 提供更容易部署的 runtime。NemoClaw blueprint 则扩展到 GeForce RTX、RTX PRO、RTX、DGX Spark 和 DGX Station,并提供更简化安装器和 Hermes Agent 支持。
H Company 的 computer-use harness 让 Agent 可以像用户一样看屏幕、操作鼠标和键盘,即使应用没有 API 也能工作。NVIDIA 表示,Holo Computer Use models 已经过量化和加速,在 NVIDIA GPU 上速度提升 2 倍,同时内存消耗降低 35%。
这些更新共同指向同一个方向:本地 Agent 不只是模型调用,而是要能安全操作应用、执行跨应用工作流,并在没有 API 的软件中完成任务。
这次更新的实际看点
NVIDIA 这组更新说明,本地 Agent 正在从“能在 PC 上跑模型”走向“能在 PC 上运行完整工作流”。硬件、模型、运行时、安全策略、应用交互和创作软件优化被放进同一条产品线中。
对个人用户来说,本地 Agent 的吸引力在于隐私、低延迟和对本地文件与应用的直接操作。对开发者和企业来说,它还意味着可以在更可控的环境中测试 Agent 工作流,而不是完全依赖云端模型和外部服务。
不过,本地 Agent 的风险也更接近用户真实设备。它可能访问文件、操作应用、执行任务,因此权限管理、日志、策略和人工确认机制会和性能一样重要。NVIDIA 与 Microsoft 在 OpenShell 和 Windows security primitives 上的合作,正是这条路线能否走向日常使用的关键。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
17GB对100GB:Qwen3.8-27B与Flash-Next做同一批任务,省下的容量换来了什么?
同做89项终端任务,17GB的27B首轮完成35项,100GB的Flash-Next完成45项;最多两次是46对53,最多四次是48对60。本文追到9月13日后续结果,区分模型能力、环境故障和返工时间;测试为苹果MLX四位量化,不是GSQ-RCO IQ3_S,也不能套到16GB显卡。
Qwen3.8-Flash-Next每秒70词元?本地加速之前,先看模型究竟改了什么
同样叫Flash-Next,70词元/秒背后可能是另一条计算路径:每词元激活专家从10减到5,再训练共享专家补偿。本文对照单台DGX Spark的两套原始资料,拆开量化、MTP、输入速度、输出速度和并发吞吐,不把128GB统一内存结果套到16GB显卡。
NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化”
可以把 NVIDIA PAIR 理解成家里本地 AI 的“派单前台”:RTX 主机、DGX Spark、Mac 就像几名能力不同的员工,PAIR 看谁在线、谁装了对应模型、谁现在最空闲,就把下一份 AI 工作交给谁。它特别适合多 Agent 并发,但不会把 16GB + 24GB 显存拼成 40GB,也不会把一个大模型拆到多台机器上。