NVIDIA 强调 GPT-5.5 与 Codex 背后的 AI 基础设施
NVIDIA 介绍 OpenAI GPT-5.5 与 Codex 在其基础设施上的应用,展示 Agent 工作负载对算力平台的新要求。
NVIDIA 介绍 GPT-5.5 驱动 Codex:Agent 工作负载背后是企业级推理基础设施
NVIDIA 在 2026 年 4 月 23 日发布文章,介绍 OpenAI 的 GPT-5.5 如何驱动 Codex,并说明 NVIDIA 内部已经在大规模使用这套能力。按照 NVIDIA 的说法,Codex 是 OpenAI 的 agentic coding application,现在由 GPT-5.5 提供支持,而 GPT-5.5 运行在 NVIDIA GB200 NVL72 rack-scale systems 上。
文章称,超过 10,000 名 NVIDIA 员工已经提前使用基于 GPT-5.5 的 Codex,覆盖 engineering、product、legal、marketing、finance、sales、HR、operations 和 developer programs 等职能。NVIDIA 将其描述为从开发者工作流走向知识工作的一个信号。
Codex 被放进企业内部真实工作流
NVIDIA 原文强调,Codex 不是只给工程师使用。虽然它首先代表 agentic coding,但 NVIDIA 内部使用人群已经扩展到产品、法务、市场、财务、人力、运营等职能。
这说明 NVIDIA 观察到的 Codex,不只是“代码生成工具”,而是可以处理信息、解决复杂问题、提出想法并推动创新的知识工作 Agent。文章中提到,调试周期从数天缩短到数小时,原本需要数周的复杂多文件代码库实验可以变成 overnight progress。
这些表述的重点不是某个 benchmark,而是企业内部使用规模和工作流变化。超过 10,000 名员工使用同一套 Agent 应用,也意味着部署方式、安全边界和基础设施稳定性都变得非常关键。
GB200 NVL72 承担前沿模型推理负载
NVIDIA 写到,GPT-5.5 运行在 GB200 NVL72 rack-scale systems 上。文章还给出一组对比数据:相较上一代系统,GB200 NVL72 可实现每百万 tokens 成本降低 35 倍,并在每兆瓦 token output per second 上提升 50 倍。
这些数字说明,前沿 Agent 能否大规模进入企业,并不只取决于模型是否强,还取决于推理成本、吞吐和功耗。Agent 应用通常需要更长上下文、多步骤推理、工具调用和反复验证,token 消耗远高于普通聊天。
如果基础设施不能把每 token 成本和功耗压下来,前沿模型即使能力足够,也很难在企业中被成千上万人持续使用。
安全部署采用云端 VM 和只读生产访问
NVIDIA 文章专门设置 “A Deployment Built for Enterprise Security” 部分,说明 Codex 在企业环境中的部署方式。原文写到,Codex app 支持 remote SSH 连接到经过批准的 cloud virtual machines,让 Agent 可以在不向外暴露真实公司数据的情况下工作。
NVIDIA IT 为每位员工 rollout cloud VM,用于安全运行 Agent。每个 Agent 都在专用 sandbox 中操作,并保持 auditability。用户可以通过熟悉的 UI 控制运行在云端 VM 中的 Codex Agent。
文章还强调,NVIDIA 的部署受 zero-data retention policy 管理,Agent 通过 command-line interfaces 和 Skills,以只读权限访问生产系统。这些细节说明,企业部署 Codex 不能只考虑模型能力,还必须设计专用计算环境、审计、数据保留策略和生产系统权限。
NVIDIA 与 OpenAI 的合作跨越训练和推理全栈
NVIDIA 在文章中回顾了与 OpenAI 超过十年的合作。双方合作从 2016 年 Jensen Huang 向 OpenAI 交付第一台 NVIDIA DGX-1 开始,延续到前沿模型训练、推理和硬件路线协同。
文章提到,NVIDIA 是 OpenAI gpt-oss open-weight model launch 的 day-zero partner,针对 NVIDIA TensorRT-LLM 以及 vLLM、Ollama 等生态框架优化模型权重。OpenAI 还承诺部署超过 10GW 的 NVIDIA systems,用于下一代 AI 基础设施。
NVIDIA 还提到,双方是早期 silicon and codesign partners,OpenAI 的反馈会影响 NVIDIA 硬件路线,OpenAI 也获得新架构早期访问。文章特别提到双方 joint bring-up 的 GB200 NVL72 100,000-GPU cluster,完成了多次大规模训练运行,并在 frontier scale 上证明系统级可靠性。
这次动态的实际看点
这篇文章的核心不是单纯说明 GPT-5.5 更强,而是展示了前沿 Agent 应用在企业内部大规模运行时需要什么基础设施:低成本高吞吐推理系统、专用 Agent 运行环境、云端 VM、只读生产访问、zero-data retention,以及可审计的操作路径。
对开发者工具来说,Codex 代表的是 Agent 工作负载:它需要长期运行、多文件理解、调试、实验和验证。对基础设施来说,这类工作负载比普通聊天更重,也更依赖 rack-scale 推理系统、网络、软件栈和企业安全设计。
如果 Codex 类工具继续扩展到更多知识工作,真正的竞争不只在模型能力,也会在企业能否以可接受成本和风险把这些 Agent 部署给大量员工。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。