点击蓝字关注我

一个爱代码的设计师在运营,不定时分享干货、学习方法、效率工具和AIGC趋势发展。个人网站:tomda.top

OpenAI 最近放出了 GPT-5.4
它已经进了 ChatGPT、API 和 Codex,其中 ChatGPT 里对应的名字是 GPT-5.4 Thinking;另外还有一个更偏高性能路线的版本,叫 GPT-5.4 Pro

 

如果只看“又发了个新模型”,这件事其实没什么稀奇。

但认真看完这次更新的重点,我的感受是:GPT-5.4 的价值,不在于参数又堆了多少,而在于它开始更像一个能真正接住复杂工作的系统。

知识工作能力,正在继续往上抬

如果说 GPT-5.2 已经把通用推理能力打下了一个不错的底子,那么 GPT-5.4 的提升,更像是把这种能力进一步兑现到了真实职业场景里。

它不是单纯“更会想了”,而是面对专业人士日常会遇到的现实任务时,输出变得更稳定、更完整,也更成熟
这种提升的意义在于,模型开始不只是偶尔答得漂亮,而是更有机会在连续、具体、标准明确的工作任务中,稳定交出像样的结果。

从基准测试来看,这一点也有比较直观的数据支撑。
在 GDPval 这项测试中,模型需要围绕 44 种职业场景,完成定义明确的知识工作任务,考察的是智能体在真实专业工作中的执行质量。

结果是,GPT-5.4 刷新了这一测试的当前最好成绩
在对比评估中,它有 83.0% 的结果达到了或超过行业专业人士水平;作为对照,GPT-5.2 的这一数字是 70.9%

这个差距不算小。
如果说过去大家对模型的印象还是“灵感型选手,偶尔超神”,那 GPT-5.4 想证明的则是另一件事:它正在从‘会做’走向‘稳定做得不错’。

而对知识工作来说,后者显然更重要。
毕竟真实职场里,最怕的不是 AI 不够惊艳,而是它时灵时不灵。能稳定交付,才是真的能上桌。

01.

知识工作

别再拿还有一个很值得注意的信号,是来自实际业务场景里的外部反馈。

 

招聘平台 Mercor 的 CEO Brendan Foody 直接给了很高的评价:在他们用于衡量专业服务场景表现的 APEX-Agents 基准上,GPT-5.4 已经冲到了榜首。按照他的说法,这是他们迄今为止测试过最强的模型,尤其擅长处理那些周期更长、交付要求更完整的任务,比如演示文稿、财务模型和法律分析。更关键的是,GPT-5.4 不只是效果强,速度更快,成本还更低。这就很现实了——不只是“能打”,而且“划算”,属于那种老板听了都容易点头的升级。

02.

原生计算机操作

 

原生“用电脑”能力,才是 GPT-5.4 最值得看的升级之一

GPT-5.4 这次最猛的地方,不只是更会答题,而是开始真正具备了原生计算机操作能力
这意味着它不再只是一个会生成文本的模型,而是更像一个能被开发者拿去搭建智能体、在网站和软件系统里直接干活的“执行核心”。

它既能通过代码操作电脑,比如调用 Playwright 这类工具完成自动化流程;也能根据屏幕截图理解当前界面,再发出鼠标和键盘指令。更重要的是,这套能力是可控的:开发者可以通过指令约束它的行为,也能配置不同的确认策略,来匹配不同场景下的风险要求。

从测试结果看,这不是概念展示,而是实打实的能力提升。
在衡量桌面环境操作能力的 OSWorld-Verified 测试中,GPT-5.4 成功率达到 75.0%,明显高于 GPT-5.2 的 47.3%,甚至超过了人类基线的 72.4%
在测试浏览器任务的 WebArena-Verified 中,GPT-5.4 的成功率为 67.3%,也高于 GPT-5.2 的 65.4%

而在 Online-Mind2Web 测试里,它仅凭截图观察,成功率就达到了 92.8%,显著领先于 ChatGPT Atlas 代理模式的 70.9%

这些数字背后说明一件事:
GPT-5.4 正在从“会回答”走向“会执行”。
对于开发者来说,这可能才是最关键的变化——AI 不只是更聪明了,而是真的开始更能把事做完了。

03.

编程

编码能力继续拉满,而且更适合长任务

在编码这件事上,GPT-5.4 基本可以理解为:继承了 GPT-5.3-Codex 的强项,同时又把知识处理、工具调用和计算机操作这些能力补得更完整了。

这点对长时间运行的任务尤其重要。
因为真正复杂的开发任务,往往不是“一次生成一段代码”就结束了,而是要边调用工具、边迭代修改、边往下推进。GPT-5.4 的提升,就体现在它更能接住这种长链路任务,减少人工反复接管。

从基准测试来看,在 SWE-Bench Pro 上,GPT-5.4 的表现已经做到与 GPT-5.3-Codex 持平,甚至在部分场景更优;同时,它在推理过程中的延迟还更低。
也就是说,代码能力没掉,速度还更快了。这对开发者来说,属于很实在的升级。

主题公园模拟游戏

只凭一段提示词,GPT-5.4 就能从零生成一个完整的经营类游戏。
道路铺设、设施建造、景观布置都能跑起来,甚至连资金、客流、满意度和评分系统也能形成完整闭环,像是徒手搓出了一个会自己运转的微观世界。

更有意思的是,这不只是“做出来了”,还经过了反复自动化测试。
Playwright 在这里更像一个高强度质检员:从疯狂扩建、设施拆除,到镜头导航、UI 数据校验,整套流程都被反复验证,最后才交付成品。

  •  
  •  
  •  
Prompt: Use $playwright-interactive and $imagegen. Create an interactive isometric theme park simulation game that I can build and navigate in the browser. Use imagegen to establish the overall visual vision and generate the game’s assets, including rides, paths, terrain, trees, water, food stalls, decorations, buildings, icons, and UI illustrations. The world should feel cohesive, polished, and visually rich, with a premium art direction that works well from an isometric perspective. Let me place and remove paths, add attractions, position scenery, and move around the park smoothly while monitoring guest activity, ride status, and park growth. Include believable guest movement, simple park management systems like money, cleanliness, queueing, and happiness, and make the experience feel playful, clear, and complete rather than like a rough prototype. Prioritize charm, readability, and strong game feel over realism. When play testing, be sure to build and expand a park through several rounds of play, verify that placement and navigation work smoothly, confirm that guests react to the park layout and attractions, and ensure the visuals, UI, and interactions feel stable and cohesive.

战棋 RPG

另一个案例,是一款回合制网格战斗游戏。
GPT-5.4 通过多轮迭代,逐步搭出了移动、行动、站位、遭遇战等一整套核心玩法,已经不是“有个壳子”,而是真有点能玩的意思。

在这个过程中,图像生成负责角色和整体美术风格,Playwright 则持续参与每一轮测试,检查界面交互、微调 UI 行为和着色器效果,直到战斗节奏、视觉表现和整体体验都被打磨到比较完整的状态。

金门大桥飞行体验

还有一个很适合拿来秀肌肉的例子,是金门大桥飞行体验。
同样是从一段提示词起步,GPT-5.4 直接生成了一个可自由飞行的超写实 3D 场景:光照、水面、雾气、悬索桥结构、桥上车流,以及周边海岸线和城市背景,细节都拉得很满,既能贴脸穿桥,也能远景俯瞰。

这里的 Playwright 更像“自动驾驶飞行测试员”,会从多个角度持续巡航,验证渲染视口稳定性,并通过截图反馈帮助 AI 继续校准构图、光影和整体画面表现。整个过程经过了长时间高频迭代,最终效果已经相当能打。

04.

工具使用

工具调用,开始变得更聪明也更省了

GPT-5.4 这次还有一个很容易被忽略、但对开发者特别关键的升级:工具使用能力更强了。

简单说,就是模型现在更能在复杂工具环境里干活了。
面对更大的工具生态,它更容易选对工具,也更能把多步骤流程顺下来,而且整体成本和延迟都压得更低。

这背后最核心的变化,是 tool search

以前模型一旦接入工具,通常要先把所有工具定义一股脑塞进 prompt 里。
如果工具少,这还好;但只要系统里工具一多,请求里就会平白多出几千甚至上万 token。结果就是三件事一起发生:更贵、更慢、上下文更拥挤。很多工具信息模型可能压根用不上,却先把“路费”交了。

而 GPT-5.4 的 tool search,思路就不一样了。
它不会一上来就把全部工具细节背在身上,而是先拿到一个轻量级的工具列表,以及“按需检索工具”的能力。等它真要调用某个工具时,再去查这个工具的定义,并把相关信息补进当前对话里。

这个改动听起来偏底层,但实际价值非常直接:
工具越多,收益越大。

因为它能明显减少工具密集型任务里的 token 消耗,同时尽量保住缓存,让请求跑得更快、成本更低。更重要的是,这也让模型更有机会在大规模工具生态里稳定工作,而不是工具一多就先被上下文压垮。

尤其是在 MCP 这类场景里,单是工具定义本身就可能占掉成千上万 token。
这时候,tool search 带来的效率提升就不是“小优化”了,而是非常实打实的性能改进。

官方拿 Scale 的 MCP Atlas 基准做过一组对比测试:
在 250 个任务、36 个 MCP 服务器同时开启的条件下,一种方案是把所有 MCP 函数直接暴露在模型上下文里,另一种方案则是全部放到 tool search 后面。结果是,后者在准确率不变的前提下,把总 token 使用量压低了 47%

这个数字很说明问题。
它意味着 GPT-5.4 的提升,不只是“更会用工具”,而是开始真正解决一个更现实的问题:
当工具规模上来之后,模型还能不能用得起、跑得动、接得住。

说白了,AI Agent 真正落地,拼的已经不只是智商了,还包括“会不会找工具、会不会省资源、会不会把流程跑顺”。
而 GPT-5.4 这一波,补的正是这块。
资料来源

https://openai.com/index/introducing-gpt-5-4/
写在  最后

GPT-5.4 这次最有意思的,不是又多会了一个新技能,而是它开始更像一个真正能干活的系统。

它不只是更会推理、更会写代码,也不只是更懂工具、更能操作电脑,而是在朝一个更现实的目标靠近:把复杂任务接住,把真实工作做完。

当模型竞争从“答得漂不漂亮”走到“活干得怎么样”,AI 的价值判断标准,其实已经变了。
真正重要的,不再只是惊艳时刻,而是稳定交付;不再只是能力上限,而是落地效率。

由于AI群聊已经满200人需邀请入群,添加微信:uiux09 备注「Ai」邀请你入群。

关于作者

数字游民Tomda

  • UIED系列创始人 网址:fsuied.com
  • 一人企业的AI实践者

一个爱写代码的设计师。 专注分享 AI 趋势、效率工具与实战干货。 关注我,不仅看热闹,更带你懂门道,告别 AI 时代的“信息焦虑”。