NVIDIA BlueField-4 STX 面向 Agentic AI 的存储瓶颈

GTC 2026 期间,NVIDIA 推出 BlueField-4 STX 存储架构,以应对长上下文和 Agentic AI 的数据吞吐需求。

浏览 12
NVIDIA BlueField-4 STX 面向 Agentic AI 的存储瓶颈封面

NVIDIA BlueField-4 STX:Agentic AI 的瓶颈开始从 GPU 转向数据通路

Tom’s Hardware 文章显示,NVIDIA 在 GTC 2026 期间推出 BlueField-4 STX,这是一套面向 agentic AI inference 的 accelerated storage 模块化参考架构。文章称,NVIDIA 在 3 月 16 日公布该架构,目标是解决限制 agentic AI 推理的数据访问瓶颈。

这条动态的重点不是单纯发布一块新卡,而是指出一个更底层的问题:当 AI Agent 运行长会话、处理扩展上下文窗口时,GPU 不一定是唯一瓶颈,数据如何存取、KV cache 如何管理、存储路径如何绕过 CPU,也会直接影响推理吞吐。

STX 解决的是长上下文下的 KV cache 压力

文章明确指出,NVIDIA 针对的具体问题是 KV cache management。在 transformer inference 中,注意力机制会为上下文中的每个 token 计算 key-value pairs,这些数据需要在后续生成步骤中不断存储和读取。

随着上下文窗口增长到数十万 tokens,KV cache 会超出 GPU HBM 容量。常见处理方式是把数据 offload 到主机 DRAM 或 NVMe storage,但这两条路径通常都会经过 CPU,带来随着上下文长度增加而累积的延迟,并导致 GPU 等待数据。

Agentic AI 恰好会放大这个问题。Agent 往往运行长会话,持续读取工具结果、上下文、历史步骤和外部资料。如果数据路径跟不上,GPU 算力就可能被存储瓶颈拖住。

BlueField-4 STX 试图绕过 CPU 存储路径

按照文章信息,BlueField-4 STX 围绕 storage-optimized BlueField-4 DPU 和 ConnectX-9 SuperNIC 构建。它通过 RDMA over Spectrum-X Ethernet,把数据路由到专门的 accelerated storage layer,从而绕过 host CPU。

BlueField-4 会直接管理 NVMe SSD,并为 KV cache 处理数据完整性和加密,让上下文可以保留在 storage processor 层访问,而不是每次都经过主机 CPU 传输。

NVIDIA 给出的性能说法是,相比传统 CPU-based storage architectures,STX 可带来最高 5 倍 token throughput、4 倍能效提升,以及 2 倍 page ingestion speed。对于长上下文和持续推理场景,这些指标直接关系到 Agent 能否在大量上下文中保持响应速度。

参考架构连接 Vera Rubin、ConnectX-9 和 CMX

文章还提到,完整 STX stack 运行在 Vera Rubin 平台上,集成 Vera CPU、ConnectX-9、Spectrum-X Ethernet、DOCA software 和 AI Enterprise software。第一个基于 STX 的 rack-scale 实现是 NVIDIA CMX context memory storage platform。

这说明 STX 不是一个孤立存储组件,而是被放进 NVIDIA 下一代 AI 数据中心平台中。它要解决的是 Agentic AI 数据中心级推理的上下文存储和访问问题,而不仅仅是某个服务器内部的 SSD 性能。

在合作方方面,文章列出 DDN、Dell Technologies、HPE、IBM、NetApp、VAST Data 等存储和基础设施供应商,以及 AIC、Supermicro、Quanta Cloud Technology 等制造伙伴。CoreWeave、Lambda、Mistral AI 和 Oracle Cloud Infrastructure 等云和 AI 提供方也承诺早期采用。

这次发布的实际看点

BlueField-4 STX 的意义在于,把 Agentic AI 的基础设施问题从“算力够不够”扩展到“上下文数据能否持续喂给模型”。长上下文、连续推理、自我学习和复杂 Agent 工作流,都需要大量中间状态和历史上下文被快速访问。

如果数据路径仍然依赖传统 CPU 中转,GPU 可能无法充分利用。STX 试图把 KV cache、NVMe、DPU、网络和数据完整性处理组合成新的 context memory storage layer。

对企业 AI 基础设施团队来说,后续值得关注的是:STX-based 平台在 2026 年下半年由合作伙伴推出后的真实表现,是否能在长上下文 Agent 推理中稳定提升吞吐、降低能耗,并减少 GPU 因数据等待产生的空转。

参考来源

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

12