GPT-5.3-Codex 发布,Codex 从代码助手转向计算机工作代理
OpenAI 在 2 月发布 GPT-5.3-Codex,强调长任务、交互式协作、编码和专业知识工作。
GPT-5.3-Codex 发布:Codex 从编码助手走向电脑工作代理
OpenAI 在 2026 年 2 月 5 日发布 GPT‑5.3‑Codex,并将其描述为当时最强的 agentic coding model。按照官方说明,GPT‑5.3‑Codex 同时推进了 GPT‑5.2‑Codex 的前沿编码表现,以及 GPT‑5.2 的推理和专业知识能力,并且速度提升 25%。
OpenAI 对这次更新的定位很明确:Codex 不再只是写代码和审查代码的 Agent,而是开始承担开发者和专业人士在电脑上可以完成的更广泛工作,包括研究、工具使用、复杂执行、调试、部署、监控、写 PRD、编辑文案、用户研究、测试、指标分析等。
GPT-5.3-Codex 把 Codex 推向更长任务
OpenAI 原文强调,GPT‑5.3‑Codex 可以处理涉及 research、tool use 和 complex execution 的 long-running tasks。用户可以在模型工作过程中持续引导它,而不丢失上下文。
这和传统 coding assistant 有明显区别。普通代码助手更像被动补全或回答问题;GPT‑5.3‑Codex 支撑的 Codex 更接近可交互的长期工作代理:它可以一边执行,一边提供进度更新,用户也能在中途提问、讨论方案并调整方向。
OpenAI 在文中把它类比为 colleague:用户不必等到最终结果出来才发现方向不对,而可以在过程中 steer and interact。
编码、网页开发和知识工作被放到同一条能力线上
在 coding 方面,OpenAI 称 GPT‑5.3‑Codex 在 SWE-Bench Pro 和 Terminal-Bench 上刷新行业高点,同时使用更少 tokens。Appendix 中列出的结果包括:SWE-Bench Pro 56.8%、Terminal-Bench 2.0 77.3%、OSWorld-Verified 64.7%、GDPval 70.9%、Cybersecurity Capture The Flag Challenges 77.6%。
在 web development 部分,OpenAI 展示了模型用数百万 tokens 自主迭代游戏和应用的例子,包括赛车游戏和潜水游戏。文章还比较了 GPT‑5.3‑Codex 和 GPT‑5.2‑Codex 在落地页生成上的差异,强调前者会给出更完整、更接近生产状态的默认实现。
在 beyond coding 部分,OpenAI 明确写到,软件工程师、设计师、产品经理和数据科学家做的远不只是生成代码。GPT‑5.3‑Codex 被设计为支持整个软件生命周期,包括调试、部署、监控、PRD、文案、用户研究、测试、指标等工作。
Codex 自己也参与了 GPT-5.3-Codex 的训练和部署
OpenAI 在原文中写到,GPT‑5.3‑Codex 是首个在创建自身过程中发挥关键作用的模型。Codex 团队使用早期版本来调试训练、管理部署、诊断测试结果和评估。
文章列举了多个内部使用场景:研究团队用 Codex 监控和调试训练运行,分析训练过程中的交互质量;工程团队用它优化和适配 GPT‑5.3‑Codex 的 harness,识别 context rendering bugs 和 cache hit rate 问题;数据科学团队用它构建新数据管道,并用比标准 dashboard 更丰富的方式可视化和分析 alpha 测试中的异常结果。
这些例子说明,Codex 在 OpenAI 内部已经不只是写代码,而是进入研究、工程、数据分析和产品迭代流程。
交互式协作是这次更新的重要变化
OpenAI 还强调,随着模型能力增强,问题会从“Agent 能不能做”转向“人类如何更容易与多个并行工作的 Agent 交互、指挥和监督”。
GPT‑5.3‑Codex 在 Codex app 中提供更频繁的更新,让用户了解关键决策和进展。用户可以设置 follow-up behavior,让模型工作时支持实时 steering。它会解释自己正在做什么,响应反馈,并让用户从开始到结束保持在工作链条中。
这对复杂任务很关键。Agent 越强,越不能只等最终输出;用户需要在过程中知道它做了什么、为什么这样做、是否需要纠偏。
这次发布的实际看点
GPT‑5.3‑Codex 的核心信号是,Codex 正在从“编码助手”向“电脑工作代理”扩展。它仍然以软件工程为核心,但能力已经覆盖网页开发、数据分析、文档、产品、测试和复杂电脑任务。
对团队来说,这意味着采用 Codex 时不能只把它放在写代码环节,而应思考它如何进入需求、实现、测试、审查、部署和知识工作流程。同时,交互式控制、任务边界、权限和验证机制会变得比以往更重要。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
17GB对100GB:Qwen3.8-27B与Flash-Next做同一批任务,省下的容量换来了什么?
同做89项终端任务,17GB的27B首轮完成35项,100GB的Flash-Next完成45项;最多两次是46对53,最多四次是48对60。本文追到9月13日后续结果,区分模型能力、环境故障和返工时间;测试为苹果MLX四位量化,不是GSQ-RCO IQ3_S,也不能套到16GB显卡。
Qwen3.8-Flash-Next每秒70词元?本地加速之前,先看模型究竟改了什么
同样叫Flash-Next,70词元/秒背后可能是另一条计算路径:每词元激活专家从10减到5,再训练共享专家补偿。本文对照单台DGX Spark的两套原始资料,拆开量化、MTP、输入速度、输出速度和并发吞吐,不把128GB统一内存结果套到16GB显卡。
NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化”
可以把 NVIDIA PAIR 理解成家里本地 AI 的“派单前台”:RTX 主机、DGX Spark、Mac 就像几名能力不同的员工,PAIR 看谁在线、谁装了对应模型、谁现在最空闲,就把下一份 AI 工作交给谁。它特别适合多 Agent 并发,但不会把 16GB + 24GB 显存拼成 40GB,也不会把一个大模型拆到多台机器上。