
谷歌的“榜首体验卡”,仅仅续费了不到一个月。
今天是 OpenAI 的十周岁生日。在这个里程碑式的日子里,OpenAI 没有搞虚的,直接反手扔了一个“王炸”。

01.模型性能
别再拿 AI 当聊天机器人了,GPT-5.2 Thinking 是真能帮你干活的。
它是 OpenAI 迄今为止最接地气、最适合真实工作场景的模型。在那个专门测试 44 种职业技能的 GDPval 评测里,GPT-5.2 创下了一个恐怖的纪录:
它是首个能力达到、甚至超越人类专家水平的 AI。
无论是做 PPT、搞复杂的 Excel 表格,还是写专业报告,在人类专家的盲评中,GPT-5.2 Thinking 有 70.9% 的表现都吊打或持平了顶尖行业人士。
更扎心的数据来了:
- 速度: 比专家快 11 倍。
- 成本: 只有专家的 1%。



编码
GPT‑5.2 Thinking 在 SWE-bench Pro 测试取得了 55.6% 的新成绩。SWE-bench Pro 是一项严格评估真实软件工程能力的基准测试。与只测试Python 的 SWE-bench Verified 不同,SWE-bench Pro 涵盖四种语言,旨在更具抗污染性、更具挑战性、更具多样性,也更贴近真实工业场景。


02. 幻觉
用过 AI 的人都懂那种痛:它编起瞎话来,比真的还真。但这次,GPT-5.2 Thinking 终于治好了这个“老毛病”。
官方数据显示,它的幻觉率比前代直接降低了 38%。
这意味着什么?以前你用它查资料、写研报、做分析,还得战战兢兢地去核实每一个数据。现在,它变得更老实、更严谨了。对于我们这种靠信息吃饭的专业人士来说,这种“少犯错”带来的安全感,比什么新功能都重要。

长上下文
256k 上下文,真正的过目不忘
如果说以前的 AI 读长文容易“看后面忘前面”,那 GPT-5.2 Thinking 这次彻底治好了“健忘症”。
即使面对 256k Token(相当于几百页厚的专业书籍或文档)的超长内容,它在抓取细节时的准确率竟然达到了接近 100%!
这是我们第一次看到有模型能做到这个地步。
哪怕你把几十份合同、一堆复杂的会议记录和十几篇论文同时丢给它,它也能在几十万字的信息海洋里,精准地把你需要的那根“针”捞出来。





下面我们将展示 GPT‑5.2 Thinking 的完整基准测试结果,并同时提供一部分 GPT‑5.2 Pro 的相关数据。
专业
| GPT-5.2 Thinking | GPT-5.2 Pro | GPT-5.1 Thinking | |
|---|---|---|---|
| GDPval (ties allowed, wins or ties) | 70.9% | 74.1% | 38.8% (GPT-5) |
| GDPval (ties allowed, clear wins) | 49.8% | 60.0% | 35.5% (GPT-5) |
| GDPval (no ties) | 61.0% | 67.6% | 37.1% (GPT-5) |
| Investment banking spreadsheet tasks (internal) | 68.4% | 71.7% | 59.1% |
编码
| GPT-5.2 Thinking | GPT-5.2 Pro | GPT-5.1 Thinking | |
|---|---|---|---|
| SWE-Bench Pro, Public | 55.6% | - | 50.8% |
| SWE-bench Verified | 80.0% | - | 76.3% |
| SWE-Lancer, IC Diamond* | 74.6% | - | 69.7% |
事实性
| GPT-5.2 Thinking | GPT-5.2 Pro | GPT-5.1 Thinking | |
|---|---|---|---|
| ChatGPT answers without errors (w/ search) | 93.9% | - | 91.2% |
| ChatGPT answers without errors (no search) | 88.0% | - | 87.3% |
长上下文
| GPT-5.2 Thinking | GPT-5.2 Pro | GPT-5.1 Thinking | |
|---|---|---|---|
| OpenAI MRCRv2, 8 needles, 4k–8k | 98.2% | - | 65.3% |
| OpenAI MRCRv2, 8 needles, 8k–16k | 89.3% | - | 47.8% |
| OpenAI MRCRv2, 8 needles, 16k–32k | 95.3% | - | 44.0% |
| OpenAI MRCRv2, 8 needles, 32k–64k | 92.0% | - | 37.8% |
| OpenAI MRCRv2, 8 needles, 64k–128k | 85.6% | - | 36.0% |
| OpenAI MRCRv2, 8 needles, 128k–256k | 77.0% | - | 29.6% |
| BrowseComp Long Context 128k | 92.0% | - | 90.0% |
| BrowseComp Long Context 256k | 89.8% | - | 89.5% |
| GraphWalks bfs <128k | 94.0% | - | 76.8% |
| Graphwalks parents <128k | 89.0% | - | 71.5% |
展望
| GPT-5.2 Thinking | GPT-5.2 Pro | GPT-5.1 Thinking | |
|---|---|---|---|
| CharXiv reasoning (no tools) | 82.1% | - | 67.0% |
| CharXiv reasoning (w/ Python) | 88.7% | - | 80.3% |
| MMMU Pro (no tools) | 79.5% | - | - |
| MMMU Pro (w/ Python) | 80.4% | - | 79.0% |
| Video MMMU (no tools) | 85.9% | - | 82.9% |
| Screenspot Pro (w/ Python) | 86.3% | - | 64.2% |
工具使用
| GPT-5.2 Thinking | GPT-5.2 Pro | GPT-5.1 Thinking | |
|---|---|---|---|
| Tau2-bench Telecom | 98.7% | - | 95.6% |
| Tau2-bench Retail | 82.0% | - | 77.9% |
| BrowseComp | 65.8% | 77.9% | 50.8% |
| Scale MCP-Atlas | 60.6% | - | 44.5% |
| Toolathlon | 46.3% | - | 36.1% |
学术
| GPT-5.2 Thinking | GPT-5.2 Pro | GPT-5.1 Thinking | |
|---|---|---|---|
| GPQA Diamond (no tools) | 92.4% | 93.2% | 88.1% |
| HLE (no tools) | 34.5% | 36.6% | 25.7% |
| HLE (w/ search, Python) | 45.5% | 50.0% | 42.7% |
| MMMLU | 89.6% | - | 89.5% |
| HMMT, Feb 2025 (no tools) | 99.4% | 100.0% | 96.3% |
| AIME 2025 (no tools) | 100.0% | 100.0% | 94.0% |
| FrontierMath Tier 1–3 (w/ Python) | 40.3% | - | 31.0% |
| FrontierMath Tier 4 (w/ Python) | 14.6% | - | 12.5% |
抽象推理
| GPT-5.2 Thinking | GPT-5.2 Pro | GPT-5.1 Thinking | |
|---|---|---|---|
| ARC-AGI-1 (Verified) | 86.2% | 90.5% | 72.8% |
| ARC-AGI-2 (Verified) | 52.9% | 54.2% (high) | 17.6% |
资料来源https://openai.com/zh-Hans-CN/index/introducing-gpt-5-2/
https://openai.com/index/ten-years/
写在 最后
附上OpenAI的10周年公开信。
OpenAI 十周年
OpenAI取得的成就远超我的想象;我们当初的目标是做一些疯狂的、几乎不可能的、前所未有的事情。从充满不确定性的开端,克服重重困难,凭借持续不断的努力,我们现在看来很有可能实现我们的使命。
十年前的今天,我们向世界宣布了我们的计划,尽管我们当时并没有正式启动。(在新窗口中打开)又过了几个星期,直到 2016 年 1 月初。
从某种意义上说,十年是一段很长的时间,但就社会变革通常所需的时间而言,十年其实并不算长。虽然日常生活与十年前并没有太大的不同,但我们今天所面临的可能性空间,与我们当年十五个书呆子围坐在一起,苦思冥想如何取得进步时所感受到的截然不同。
回看早期的照片,我首先注意到的是大家看起来都好年轻。但随后,我又注意到大家那种异乎寻常的乐观和快乐。那是一段疯狂而又充满乐趣的时光:尽管我们不被人理解,但我们却有着坚定的信念,觉得这件事意义非凡,即使成功的机会渺茫也值得全力以赴;我们拥有才华横溢的人,以及清晰的目标。
随着我们取得一些成功(以及许多失败),我们逐渐对现状有了更清晰的认识。那时,要确定具体应该做什么并不容易,但我们建立了一种鼓励探索的卓越文化。深度学习无疑是一项伟大的技术,但如果没有在现实世界中积累应用经验就贸然开发,似乎不太合适。我在此略过我们所做的一切(希望将来有人能写成一部历史著作),但我们始终秉持着一种积极进取的精神,不断探索眼前的下一个挑战:研究的下一步方向是什么?如何筹集资金购买更强大的计算机?等等。我们率先开展了使人工智能安全可靠且切实可行的技术工作,这种精神一直延续至今。
2017年,我们取得了一些奠基性的成果:Dota 1v1 的实验结果,将强化学习推向了新的规模;无监督情感神经元实验,证明语言模型能够清晰地学习语义,而不仅仅是语法;以及基于人类偏好的强化学习成果,展示了将人工智能与人类价值观相契合的初步途径。当时,创新远未结束,但我们深知,需要借助强大的计算能力来扩展这些成果。
我们坚持不懈,不断改进技术,并在三年前推出了 ChatGPT。世界为之瞩目,而 GPT-4 的发布更是引起了广泛关注;突然之间,通用人工智能(AGI)不再是天方夜谭。过去的三年极其紧张,压力巨大,责任重大;这项技术以前所未有的规模和速度融入了世界。这需要极其高超的执行力,我们必须迅速培养新的能力来应对。在如此短的时间内从零发展成为一家庞大的公司绝非易事,我们每周都要做出数百个决策。我为团队做出的众多正确决策感到自豪,而那些错误决策大多是我的责任。
我们不得不做出一些新的决策;例如,在思考如何让人工智能最大限度地造福世界时,我们制定了一项迭代部署策略,将早期版本的技术成功推向市场,让人们形成认知,社会与技术共同演进。这在当时颇具争议,但我认为这是我们做出的最明智的决策之一,如今已成为行业标准。
OpenAI 成立十年以来,我们拥有的 AI 能够在最艰难的智力竞赛中胜过我们大多数最聪明的人。
世界已经利用这项技术创造了非凡的成就,我们期待明年还能看到更多非凡的成果。迄今为止,世界在减轻潜在的负面影响方面也做得不错,我们需要继续努力,保持这种势头。
我从未像现在这样对我们的研发和产品路线图,以及实现我们使命的整体方向感到如此乐观。我相信,再过十年,我们几乎肯定能够打造出超级智能。我预感未来会有些奇特;在某种程度上,日常生活和我们最关心的事情几乎不会发生太大变化,而且我相信,我们会继续更加关注其他人所做的事情,而不是机器所做的事情。但在另一方面,2035年的人们将能够做到我们现在难以想象的事情。
我衷心感谢那些信任我们并使用我们的产品创造佳绩的个人和公司。如果没有他们的支持,我们或许还只是实验室里的一项技术;我们的用户和客户在很多情况下都对我们寄予了过高的期望,没有他们的支持,我们的工作不可能达到今天的成就。
我们的使命是确保通用人工智能(AGI)造福全人类。我们面前还有很多工作要做,但我为团队目前的发展方向感到非常自豪。我们已经看到人们利用这项技术所取得的巨大成果,而且我们知道,未来几年还将有更多成果涌现。









评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。