图片

谷歌的“榜首体验卡”,仅仅续费了不到一个月。

今天是 OpenAI 的十周岁生日。在这个里程碑式的日子里,OpenAI 没有搞虚的,直接反手扔了一个“王炸”。
图片
本周五,OpenAI 正式推出了他们迄今为止最强的杀手锏 —— GPT-5.2 系列。这一次,他们剑指巅峰,誓要重新定义什么才是“专业知识工作”的天花板。
图片

01.模型性能

别再拿 AI 当聊天机器人了,GPT-5.2 Thinking 是真能帮你干活的。

它是 OpenAI 迄今为止最接地气、最适合真实工作场景的模型。在那个专门测试 44 种职业技能的 GDPval 评测里,GPT-5.2 创下了一个恐怖的纪录:

它是首个能力达到、甚至超越人类专家水平的 AI。

无论是做 PPT、搞复杂的 Excel 表格,还是写专业报告,在人类专家的盲评中,GPT-5.2 Thinking 有 70.9% 的表现都吊打或持平了顶尖行业人士。

更扎心的数据来了:

  • 速度: 比专家快 11 倍
  • 成本: 只有专家的 1%
这意味着什么?在你的监督下,它就是一个不睡觉、不抱怨、还贼便宜的顶级助手
图片
图片
图片

编码

GPT‑5.2 Thinking 在 SWE-bench Pro 测试取得了 55.6% 的新成绩。SWE-bench Pro 是一项严格评估真实软件工程能力的基准测试。与只测试Python 的 SWE-bench Verified 不同,SWE-bench Pro 涵盖四种语言,旨在更具抗污染性、更具挑战性、更具多样性,也更贴近真实工业场景。
图片
图片
图片

02. 幻觉

用过 AI 的人都懂那种痛:它编起瞎话来,比真的还真。但这次,GPT-5.2 Thinking 终于治好了这个“老毛病”。

官方数据显示,它的幻觉率比前代直接降低了 38%

这意味着什么?以前你用它查资料、写研报、做分析,还得战战兢兢地去核实每一个数据。现在,它变得更老实、更严谨了。对于我们这种靠信息吃饭的专业人士来说,这种“少犯错”带来的安全感,比什么新功能都重要。

图片

长上下文

256k 上下文,真正的过目不忘

如果说以前的 AI 读长文容易“看后面忘前面”,那 GPT-5.2 Thinking 这次彻底治好了“健忘症”。

即使面对 256k Token(相当于几百页厚的专业书籍或文档)的超长内容,它在抓取细节时的准确率竟然达到了接近 100%

这是我们第一次看到有模型能做到这个地步。


哪怕你把几十份合同、一堆复杂的会议记录和十几篇论文同时丢给它,它也能在几十万字的信息海洋里,精准地把你需要的那根“针”捞出来。

图片
图片

图片
图片
图片

下面我们将展示 GPT‑5.2 Thinking 的完整基准测试结果,并同时提供一部分 GPT‑5.2 Pro 的相关数据。

专业
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
GDPval (ties allowed, wins or ties)70.9%74.1%38.8% (GPT-5)
GDPval (ties allowed, clear wins)49.8%60.0%35.5% (GPT-5)
GDPval (no ties)61.0%67.6%37.1% (GPT-5)
Investment banking spreadsheet tasks (internal)68.4%71.7%59.1%
编码
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
SWE-Bench Pro, Public55.6%-50.8%
SWE-bench Verified80.0%-76.3%
SWE-Lancer, IC Diamond*74.6%-69.7%
事实性
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
ChatGPT answers without errors (w/ search)93.9%-91.2%
ChatGPT answers without errors (no search)88.0%-87.3%
长上下文
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
OpenAI MRCRv2, 8 needles, 4k–8k98.2%-65.3%
OpenAI MRCRv2, 8 needles, 8k–16k89.3%-47.8%
OpenAI MRCRv2, 8 needles, 16k–32k95.3%-44.0%
OpenAI MRCRv2, 8 needles, 32k–64k92.0%-37.8%
OpenAI MRCRv2, 8 needles, 64k–128k85.6%-36.0%
OpenAI MRCRv2, 8 needles, 128k–256k77.0%-29.6%
BrowseComp Long Context 128k92.0%-90.0%
BrowseComp Long Context 256k89.8%-89.5%
GraphWalks bfs <128k94.0%-76.8%
Graphwalks parents <128k89.0%-71.5%
展望
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
CharXiv reasoning (no tools)82.1%-67.0%
CharXiv reasoning (w/ Python)88.7%-80.3%
MMMU Pro (no tools)79.5%--
MMMU Pro (w/ Python)80.4%-79.0%
Video MMMU (no tools)85.9%-82.9%
Screenspot Pro (w/ Python)86.3%-64.2%
工具使用
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
Tau2-bench Telecom98.7%-95.6%
Tau2-bench Retail82.0%-77.9%
BrowseComp65.8%77.9%50.8%
Scale MCP-Atlas60.6%-44.5%
Toolathlon46.3%-36.1%
学术
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
GPQA Diamond (no tools)92.4%93.2%88.1%
HLE (no tools)34.5%36.6%25.7%
HLE (w/ search, Python)45.5%50.0%42.7%
MMMLU89.6%-89.5%
HMMT, Feb 2025 (no tools)99.4%100.0%96.3%
AIME 2025 (no tools)100.0%100.0%94.0%
FrontierMath Tier 1–3 (w/ Python)40.3%-31.0%
FrontierMath Tier 4 (w/ Python)14.6%-12.5%
抽象推理
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
ARC-AGI-1 (Verified)86.2%90.5%72.8%
ARC-AGI-2 (Verified)52.9%54.2% (high)17.6%

资料来源https://openai.com/zh-Hans-CN/index/introducing-gpt-5-2/

https://openai.com/index/ten-years/
写在  最后

附上OpenAI的10周年公开信。

OpenAI 十周年

OpenAI取得的成就远超我的想象;我们当初的目标是做一些疯狂的、几乎不可能的、前所未有的事情。从充满不确定性的开端,克服重重困难,凭借持续不断的努力,我们现在看来很有可能实现我们的使命。

十年前的今天,我们向世界宣布了我们的计划,尽管我们当时并没有正式启动。(在新窗口中打开)又过了几个星期,直到 2016 年 1 月初。

从某种意义上说,十年是一段很长的时间,但就社会变革通常所需的时间而言,十年其实并不算长。虽然日常生活与十年前并没有太大的不同,但我们今天所面临的可能性空间,与我们当年十五个书呆子围坐在一起,苦思冥想如何取得进步时所感受到的截然不同。

回看早期的照片,我首先注意到的是大家看起来都好年轻。但随后,我又注意到大家那种异乎寻常的乐观和快乐。那是一段疯狂而又充满乐趣的时光:尽管我们不被人理解,但我们却有着坚定的信念,觉得这件事意义非凡,即使成功的机会渺茫也值得全力以赴;我们拥有才华横溢的人,以及清晰的目标。

随着我们取得一些成功(以及许多失败),我们逐渐对现状有了更清晰的认识。那时,要确定具体应该做什么并不容易,但我们建立了一种鼓励探索的卓越文化。深度学习无疑是一项伟大的技术,但如果没有在现实世界中积累应用经验就贸然开发,似乎不太合适。我在此略过我们所做的一切(希望将来有人能写成一部历史著作),但我们始终秉持着一种积极进取的精神,不断探索眼前的下一个挑战:研究的下一步方向是什么?如何筹集资金购买更强大的计算机?等等。我们率先开展了使人工智能安全可靠且切实可行的技术工作,这种精神一直延续至今。

2017年,我们取得了一些奠基性的成果:Dota 1v1 的实验结果,将强化学习推向了新的规模;无监督情感神经元实验,证明语言模型能够清晰地学习语义,而不仅仅是语法;以及基于人类偏好的强化学习成果,展示了将人工智能与人类价值观相契合的初步途径。当时,创新远未结束,但我们深知,需要借助强大的计算能力来扩展这些成果。

我们坚持不懈,不断改进技术,并在三年前推出了 ChatGPT。世界为之瞩目,而 GPT-4 的发布更是引起了广泛关注;突然之间,通用人工智能(AGI)不再是天方夜谭。过去的三年极其紧张,压力巨大,责任重大;这项技术以前所未有的规模和速度融入了世界。这需要极其高超的执行力,我们必须迅速培养新的能力来应对。在如此短的时间内从零发展成为一家庞大的公司绝非易事,我们每周都要做出数百个决策。我为团队做出的众多正确决策感到自豪,而那些错误决策大多是我的责任。

我们不得不做出一些新的决策;例如,在思考如何让人工智能最大限度地造福世界时,我们制定了一项迭代部署策略,将早期版本的技术成功推向市场,让人们形成认知,社会与技术共同演进。这在当时颇具争议,但我认为这是我们做出的最明智的决策之一,如今已成为行业标准。

OpenAI 成立十年以来,我们拥有的 AI 能够在最艰难的智力竞赛中胜过我们大多数最聪明的人。

世界已经利用这项技术创造了非凡的成就,我们期待明年还能看到更多非凡的成果。迄今为止,世界在减轻潜在的负面影响方面也做得不错,我们需要继续努力,保持这种势头。

我从未像现在这样对我们的研发和产品路线图,以及实现我们使命的整体方向感到如此乐观。我相信,再过十年,我们几乎肯定能够打造出超级智能。我预感未来会有些奇特;在某种程度上,日常生活和我们最关心的事情几乎不会发生太大变化,而且我相信,我们会继续更加关注其他人所做的事情,而不是机器所做的事情。但在另一方面,2035年的人们将能够做到我们现在难以想象的事情。

我衷心感谢那些信任我们并使用我们的产品创造佳绩的个人和公司。如果没有他们的支持,我们或许还只是实验室里的一项技术;我们的用户和客户在很多情况下都对我们寄予了过高的期望,没有他们的支持,我们的工作不可能达到今天的成就。

我们的使命是确保通用人工智能(AGI)造福全人类。我们面前还有很多工作要做,但我为团队目前的发展方向感到非常自豪。我们已经看到人们利用这项技术所取得的巨大成果,而且我们知道,未来几年还将有更多成果涌现。