NVIDIA BlueField-4 STX 面向 Agentic AI 的存储瓶颈
GTC 2026 期间,NVIDIA 推出 BlueField-4 STX 存储架构,以应对长上下文和 Agentic AI 的数据吞吐需求。
NVIDIA BlueField-4 STX:Agentic AI 的瓶颈开始从 GPU 转向数据通路
Tom’s Hardware 文章显示,NVIDIA 在 GTC 2026 期间推出 BlueField-4 STX,这是一套面向 agentic AI inference 的 accelerated storage 模块化参考架构。文章称,NVIDIA 在 3 月 16 日公布该架构,目标是解决限制 agentic AI 推理的数据访问瓶颈。
这条动态的重点不是单纯发布一块新卡,而是指出一个更底层的问题:当 AI Agent 运行长会话、处理扩展上下文窗口时,GPU 不一定是唯一瓶颈,数据如何存取、KV cache 如何管理、存储路径如何绕过 CPU,也会直接影响推理吞吐。
STX 解决的是长上下文下的 KV cache 压力
文章明确指出,NVIDIA 针对的具体问题是 KV cache management。在 transformer inference 中,注意力机制会为上下文中的每个 token 计算 key-value pairs,这些数据需要在后续生成步骤中不断存储和读取。
随着上下文窗口增长到数十万 tokens,KV cache 会超出 GPU HBM 容量。常见处理方式是把数据 offload 到主机 DRAM 或 NVMe storage,但这两条路径通常都会经过 CPU,带来随着上下文长度增加而累积的延迟,并导致 GPU 等待数据。
Agentic AI 恰好会放大这个问题。Agent 往往运行长会话,持续读取工具结果、上下文、历史步骤和外部资料。如果数据路径跟不上,GPU 算力就可能被存储瓶颈拖住。
BlueField-4 STX 试图绕过 CPU 存储路径
按照文章信息,BlueField-4 STX 围绕 storage-optimized BlueField-4 DPU 和 ConnectX-9 SuperNIC 构建。它通过 RDMA over Spectrum-X Ethernet,把数据路由到专门的 accelerated storage layer,从而绕过 host CPU。
BlueField-4 会直接管理 NVMe SSD,并为 KV cache 处理数据完整性和加密,让上下文可以保留在 storage processor 层访问,而不是每次都经过主机 CPU 传输。
NVIDIA 给出的性能说法是,相比传统 CPU-based storage architectures,STX 可带来最高 5 倍 token throughput、4 倍能效提升,以及 2 倍 page ingestion speed。对于长上下文和持续推理场景,这些指标直接关系到 Agent 能否在大量上下文中保持响应速度。
参考架构连接 Vera Rubin、ConnectX-9 和 CMX
文章还提到,完整 STX stack 运行在 Vera Rubin 平台上,集成 Vera CPU、ConnectX-9、Spectrum-X Ethernet、DOCA software 和 AI Enterprise software。第一个基于 STX 的 rack-scale 实现是 NVIDIA CMX context memory storage platform。
这说明 STX 不是一个孤立存储组件,而是被放进 NVIDIA 下一代 AI 数据中心平台中。它要解决的是 Agentic AI 数据中心级推理的上下文存储和访问问题,而不仅仅是某个服务器内部的 SSD 性能。
在合作方方面,文章列出 DDN、Dell Technologies、HPE、IBM、NetApp、VAST Data 等存储和基础设施供应商,以及 AIC、Supermicro、Quanta Cloud Technology 等制造伙伴。CoreWeave、Lambda、Mistral AI 和 Oracle Cloud Infrastructure 等云和 AI 提供方也承诺早期采用。
这次发布的实际看点
BlueField-4 STX 的意义在于,把 Agentic AI 的基础设施问题从“算力够不够”扩展到“上下文数据能否持续喂给模型”。长上下文、连续推理、自我学习和复杂 Agent 工作流,都需要大量中间状态和历史上下文被快速访问。
如果数据路径仍然依赖传统 CPU 中转,GPU 可能无法充分利用。STX 试图把 KV cache、NVMe、DPU、网络和数据完整性处理组合成新的 context memory storage layer。
对企业 AI 基础设施团队来说,后续值得关注的是:STX-based 平台在 2026 年下半年由合作伙伴推出后的真实表现,是否能在长上下文 Agent 推理中稳定提升吞吐、降低能耗,并减少 GPU 因数据等待产生的空转。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。