OpenAI 发布 GPT-5.4,强调专业知识工作和 Agent 执行能力

OpenAI 在 3 月发布 GPT-5.4,强调面向知识工作、编码、工具调用和计算机使用的综合能力。

浏览 9
OpenAI 发布 GPT-5.4,强调专业知识工作和 Agent 执行能力封面

GPT-5.4 发布:专业工作、长上下文和工具调用成为模型主线

OpenAI 在 2026 年 3 月 5 日发布 GPT‑5.4,并将其称为目前最强、最高效的 professional work 前沿模型。按照官方说明,GPT‑5.4 同时面向 ChatGPT、API 和 Codex 推出;GPT‑5.4 Pro 也面向 ChatGPT 和 API 发布,用于更复杂任务。

OpenAI 对 GPT‑5.4 的定位很清楚:它把推理、编码和 agentic workflows 的最新进展整合到一个模型中,同时加强对 spreadsheets、presentations、documents、tools、software environments 和 professional tasks 的处理能力。

GDPval 显示专业工作能力继续提升

OpenAI 在发布中列出多项评估。GPT‑5.4 在 GDPval 中达到 83.0% wins or ties,高于 GPT‑5.3‑Codex 和 GPT‑5.2 的 70.9%。GDPval 用于评估模型在 44 个职业中的 well-specified knowledge work tasks 表现。

OpenAI 还引用 Mercor CEO Brendan Foody 的反馈,称 GPT‑5.4 在 APEX-Agents benchmark 上表现领先,适合 professional services work,尤其擅长 slide decks、financial models 和 legal analysis 等长程交付物。

这些信息说明,GPT‑5.4 的专业工作定位不是泛泛的写作辅助,而是指向更具体的职业产出:表格、演示、法律分析、财务模型、文档和多步骤材料整理。

ChatGPT 中增加 upfront plan,支持中途调整

OpenAI 在原文中提到,GPT‑5.4 Thinking 在 ChatGPT 中可以提供 upfront plan,让用户在模型工作中途调整方向,从而减少额外轮次,让最终输出更贴近需求。

这体现出专业工作场景里的一个关键问题:用户不一定能一次把任务说清楚,模型也不应该等到最后才给出完整结果。提前展示计划,让用户在执行中校准,是让 Agent 更像协作者的重要设计。

OpenAI 还表示,GPT‑5.4 Thinking 改进了 deep web research,尤其是高度具体的查询,并能更好地保持需要较长思考的问题上下文。

长上下文和工具调用支撑复杂项目

GPT‑5.4 支持最高 1M tokens context,让 Agent 能在长任务中计划、执行和验证。对于专业工作,这意味着模型可以处理更大的文档包、更长的项目背景和更复杂的多来源材料。

在 tool use 部分,OpenAI 介绍了 tool search 和 agentic tool calling。Tool search 让模型面对大量工具时,不必一次性把所有工具定义放进上下文,而是在需要时搜索并加入工具定义。OpenAI 在 MCP Atlas 250 个任务上测试,tool-search 配置在保持相同准确率的同时,将总 token 使用降低 47%。

Agentic tool calling 则提升模型在真实工具和 API 任务中的使用准确性和效率。OpenAI 用 Toolathlon、τ2-bench 等评估说明 GPT‑5.4 在多步骤工具使用中相比 GPT‑5.2 更强。

Coding、computer use 和 professional work 被放到同一模型里

GPT‑5.4 同时继承 GPT‑5.3‑Codex 的编码能力,并加强 computer use。OpenAI 表示,它在 SWE-Bench Pro 上达到 57.7%,在 OSWorld-Verified 上达到 75.0%,在 Toolathlon 上达到 54.6%,BrowseComp 上达到 82.7%。

这说明 GPT‑5.4 的专业工作能力不是独立于工具和代码之外。真实工作往往需要读取网页、操作软件、调用 API、生成表格、分析文件、写代码或自动化流程。OpenAI 将这些能力整合在一个模型中,是为了让它更适合端到端完成复杂任务。

对用户来说,这意味着 GPT‑5.4 不只是更会写,更能执行。它可以更好地把研究、分析、工具调用、文档生成和软件操作连接起来。

安全和定价决定能否进入日常工作流

OpenAI 在可用性部分说明,GPT‑5.4 正在 ChatGPT 和 Codex 中逐步推出,API 中可用模型名为 gpt-5.4,GPT‑5.4 Pro 以 gpt-5.4-pro 提供给需要最高性能的开发者。

对于专业工作模型来说,可用性和价格不是附属内容。企业和个人用户要把模型放进日常工作流,需要知道它在哪里可用、是否能通过 API 接入、是否有更高性能版本,以及成本是否可控。

OpenAI 也在发布中设置 Safety 部分。模型越能处理真实工作、调用工具和操作软件,就越需要用户保留检查、确认和审查机制。

这次发布的实际看点

GPT‑5.4 的核心不是单一能力升级,而是把 professional knowledge work、coding、computer use、tool search、agentic web search 和长上下文放到同一个模型里。

这代表前沿模型竞争正在从“单项能力最强”转向“能否稳定完成真实复杂工作”。对用户来说,后续真正值得观察的是 GPT‑5.4 能否在长文档、表格、演示、网页研究、软件操作和多步骤工具调用中持续保持可靠。

参考来源

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

9