GPT-5.3-Codex 发布,Codex 从代码助手转向计算机工作代理
OpenAI 在 2 月发布 GPT-5.3-Codex,强调长任务、交互式协作、编码和专业知识工作。
GPT-5.3-Codex 发布:Codex 从编码助手走向电脑工作代理
OpenAI 在 2026 年 2 月 5 日发布 GPT‑5.3‑Codex,并将其描述为当时最强的 agentic coding model。按照官方说明,GPT‑5.3‑Codex 同时推进了 GPT‑5.2‑Codex 的前沿编码表现,以及 GPT‑5.2 的推理和专业知识能力,并且速度提升 25%。
OpenAI 对这次更新的定位很明确:Codex 不再只是写代码和审查代码的 Agent,而是开始承担开发者和专业人士在电脑上可以完成的更广泛工作,包括研究、工具使用、复杂执行、调试、部署、监控、写 PRD、编辑文案、用户研究、测试、指标分析等。
GPT-5.3-Codex 把 Codex 推向更长任务
OpenAI 原文强调,GPT‑5.3‑Codex 可以处理涉及 research、tool use 和 complex execution 的 long-running tasks。用户可以在模型工作过程中持续引导它,而不丢失上下文。
这和传统 coding assistant 有明显区别。普通代码助手更像被动补全或回答问题;GPT‑5.3‑Codex 支撑的 Codex 更接近可交互的长期工作代理:它可以一边执行,一边提供进度更新,用户也能在中途提问、讨论方案并调整方向。
OpenAI 在文中把它类比为 colleague:用户不必等到最终结果出来才发现方向不对,而可以在过程中 steer and interact。
编码、网页开发和知识工作被放到同一条能力线上
在 coding 方面,OpenAI 称 GPT‑5.3‑Codex 在 SWE-Bench Pro 和 Terminal-Bench 上刷新行业高点,同时使用更少 tokens。Appendix 中列出的结果包括:SWE-Bench Pro 56.8%、Terminal-Bench 2.0 77.3%、OSWorld-Verified 64.7%、GDPval 70.9%、Cybersecurity Capture The Flag Challenges 77.6%。
在 web development 部分,OpenAI 展示了模型用数百万 tokens 自主迭代游戏和应用的例子,包括赛车游戏和潜水游戏。文章还比较了 GPT‑5.3‑Codex 和 GPT‑5.2‑Codex 在落地页生成上的差异,强调前者会给出更完整、更接近生产状态的默认实现。
在 beyond coding 部分,OpenAI 明确写到,软件工程师、设计师、产品经理和数据科学家做的远不只是生成代码。GPT‑5.3‑Codex 被设计为支持整个软件生命周期,包括调试、部署、监控、PRD、文案、用户研究、测试、指标等工作。
Codex 自己也参与了 GPT-5.3-Codex 的训练和部署
OpenAI 在原文中写到,GPT‑5.3‑Codex 是首个在创建自身过程中发挥关键作用的模型。Codex 团队使用早期版本来调试训练、管理部署、诊断测试结果和评估。
文章列举了多个内部使用场景:研究团队用 Codex 监控和调试训练运行,分析训练过程中的交互质量;工程团队用它优化和适配 GPT‑5.3‑Codex 的 harness,识别 context rendering bugs 和 cache hit rate 问题;数据科学团队用它构建新数据管道,并用比标准 dashboard 更丰富的方式可视化和分析 alpha 测试中的异常结果。
这些例子说明,Codex 在 OpenAI 内部已经不只是写代码,而是进入研究、工程、数据分析和产品迭代流程。
交互式协作是这次更新的重要变化
OpenAI 还强调,随着模型能力增强,问题会从“Agent 能不能做”转向“人类如何更容易与多个并行工作的 Agent 交互、指挥和监督”。
GPT‑5.3‑Codex 在 Codex app 中提供更频繁的更新,让用户了解关键决策和进展。用户可以设置 follow-up behavior,让模型工作时支持实时 steering。它会解释自己正在做什么,响应反馈,并让用户从开始到结束保持在工作链条中。
这对复杂任务很关键。Agent 越强,越不能只等最终输出;用户需要在过程中知道它做了什么、为什么这样做、是否需要纠偏。
这次发布的实际看点
GPT‑5.3‑Codex 的核心信号是,Codex 正在从“编码助手”向“电脑工作代理”扩展。它仍然以软件工程为核心,但能力已经覆盖网页开发、数据分析、文档、产品、测试和复杂电脑任务。
对团队来说,这意味着采用 Codex 时不能只把它放在写代码环节,而应思考它如何进入需求、实现、测试、审查、部署和知识工作流程。同时,交互式控制、任务边界、权限和验证机制会变得比以往更重要。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。