OpenAI的新一代旗舰模型GPT-5.4正引发行业关注,其最突出的卖点是最高可达100万token的上下文窗口,远超此前各版本。官方将其定位为”面向专业工作的最强前沿模型”,在ChatGPT中以上下两个版本呈现:GPT-5.4 Thinking面向Plus、Team与Pro用户,GPT-5.4 Pro则仅向每月200美元的ChatGPT Pro与Enterprise订阅开放。

百万级上下文的意义在于,模型能够一次性读入整本代码库、整套合同文档或长时长的多轮对话,并在其中完成跨页检索与推理,而不必依赖外部切分。OpenAI同时为API与Codex开放了最高100万token的上下文上限,这也是该公司迄今提供的最大上下文窗口,对法律、金融、科研等长文档密集型工作流尤其重要。
长上下文并非没有代价。官方定价显示,标准输入价格从GPT-5.2时代的每百万token 1.75美元上调至2.50美元,涨幅约43%;超过27.2万token的请求,输入价格翻倍、输出加收50%。OpenAI解释称,更强的能力与更高的推理效率意味着解决问题所需token更少,总体成本未必上升。

性能数据同样抢眼:在OSWorld-Verified基准上,GPT-5.4以75.0%的成功率大幅超越GPT-5.2的47.3%,并超过该测试报告的人类表现72.4%;在衡量网页检索能力的BrowseComp上,GPT-5.4比前代提升17个百分点,Pro版本达到89.3%。OpenAI自研的GDPval测试给出83%的得分,意味其在覆盖美国GDP九大行业的知识工作任务上已达到或超过从业者水平。
让”专业工作”落到实处的,是模型首次内置的原生计算机使用能力(Native Computer Use)。GPT-5.4既能通过编写代码驱动浏览器工具执行操作,也能直接依据屏幕截图发出鼠标与键盘指令,从而在软件环境中完成”构建—运行—验证—修复”的循环。电子表格建模得分从GPT-5.2的68.4%跃升至87.3%,即是这一能力的缩影。

对开发者影响较大的另一项新特性是Tool Search:在API中调用工具时,模型可以自动检索并选用合适的工具,而无需开发者把每个函数都塞进上下文,配合百万级上下文窗口,长会话与复杂智能体工作流的构建门槛被进一步降低。随着GPT-5.4分批推向ChatGPT、API与Codex,新一轮智能体开发浪潮正在加速到来。
OpenClaw—AI研究