● 砚数 · 模型评测
![]()
砚数批注:为什么读这篇:Mollick 不跑 benchmark,而是把 GPT-5.5 扔进真实工作流压榨,结论比任何榜单都可信。
曲线上令人印象深刻的一步
我提前拿到了 GPT-5.5 的访问权限,我觉得这是个大事。说它大事,有三个理由:它说明 AI 的快速进步还没到头;它本身确实好用;以及,即便如此,AI 能力的前沿依然是锯齿状的。
随着 AI 越来越强,每一代的提升越来越难一眼看出来,以前 AI 不行的那些事(比如数学、数单词里有几个字母)现在都成了 trivial。所以我不急着给结论,先给个简单的例子。AI 最擅长的是写代码,于是我把一个编程挑战丢给一串模型,从 OpenAI 第一个推理模型 o3(一年零一周前发布的!)到当前最强的开源权重模型 Kimi K2.6,再到新的 GPT-5.5 Pro:「给我做一个程序化生成的 3D 模拟,展现一个海港小镇从公元前 3000 年到公元 3000 年的演化,要好看,并且让我能一定程度控制它。」
我把每个模型的答案都发到了一个画廊页里(其实这个画廊页是让 GPT-5.5 Codex 帮我搭的),你可以自己玩玩感受差别。除了其它维度都更强,只有 GPT-5.5 Pro 真正模拟了一个"演化中的小镇",而不是只随时间生成新的建筑替换旧的。GPT-5.5 Pro 也比上一代快很多:GPT-5.4 Pro 完成这个任务花了 33 分钟,GPT-5.5 Pro 只用了 20 分钟。
砚数批注:文中最反直觉的一点:四个 prompt 让 GPT-5.5 产出「可接受的博士二年级论文」,但虚构仍然扁平、假设有时无趣。锯齿状前沿不是 bug,是模型能力的本质,强的地方神级,弱的地方平庸。
模型、应用与框架
我一直劝你别把 AI 当成一个东西,而是看成三个 interlocking 的概念。你要区分模型(比如 Opus 4.7、Gemini 3.1,以及现在的 GPT-5.5)、应用(你实际用来和模型对话、让模型替你干活的那些产品,最常见的是各家官网 chatgpt.com、claude.ai、gemini.google.com,但 Claude Code、Claude Cowork、OpenAI Codex 这类桌面应用正变得越来越有用),以及框架(harnesses,即 AI 能用的工具,以及模型怎么接入这些工具,工具让 AI 能控制你的电脑、写代码、做研究、画图)。
OpenAI 在这三个方向都进了。模型上,GPT-5.5 是个强模型家族,其中 GPT-5.5 Pro(仅网站可用)最强。应用上,Codex 正沿着优秀的 Claude Code 的路子走,做成了一个好用的桌面应用。框架和工具也有不少新进展,最有意思的之一是 OpenAI 的新图像模型。
这个新模型能渲染高质量文字、生成你描述得出的几乎任何图。老读者知道我的"水獭测试",让 AI 画一只在水上飞机里用 wifi 的水獭。这次让新图像模型(有时叫 GPT-imagegen-2)自己来解释:「一张水獭科学家的照片,正在演示 Ethan Mollick 水獭测试的结果,展示 AI 图像生成器能把水獭坐在飞机上用 wifi 的画面做得多好。」
想看相关学术论文?「给我看水獭测试论文的第一页,排版工整,放在书桌上。」想做成艺术?「现在做一个精致的艺术画廊,墙上每幅画都是水獭在飞机上用笔记本,风格涵盖 Klimt、Rothko、Matisse、Monet、Picasso、Titian、Rembrandt、O'Keefe,每幅下面要有可读的标签。」(这个值得放大看。)这些都很酷,几个月前还不可能,但也确实有用,能精确排字和出图的图像生成器,可以做 PPT、产品原型、示例网站,anything。
但这只是一个工具。真正的魔法发生在你把框架、应用、模型拧到同一个真问题上。下面这个我拖延了十年的事。
拧到一起
我是学者,很多非 AI 的工作,尤其 2010 年代初,集中在众筹研究上。我攒了几百个匿名数据文件,来自问卷、分析和研究,是 STATA、CSV、XLS、Word 的大杂烩,一直没抽出空写论文。我想看看 GPT-5.5 能把这些用到什么程度。于是用 GPT-5.5 驱动的 Codex 发问:「帮我把这些数据整理好,生成一个可能有意思的新假设,用复杂的方法验证它,写一篇学术论文。」我还让它包含文献综述和排版。结果非常惊艳,尤其是我让 GPT-5.5 Pro 对论文提了意见、再把意见喂回 Codex 之后。(结果可读。)它不完美,但不再是那种明显的错误:文献综述是真的,统计也是真的。问题出在,作为专家,我觉得那个假设不够有意思,而且有些关于因果性的常规顾虑,即便 AI 用了很高级的统计方法去处理。总之,如果这是某个博士二年级项目的产出,我会很满意。而我只是发了四个 prompt,自己一个字没碰。
我们还能用另一种方式把框架、应用、模型拧起来。我让 Codex 创造一个全新的桌游,基本是它自创的「龙与地下城」,一个自己发明的奇幻世界,配齐所有要用的表格和规则。我还让它模拟玩家体验游戏,并据此修订规则。(如你所见,AI 照做了,还排了一本好看的 101 页 PDF,并用它的图像生成器做了插图。)技术上很 neat,内容也多有可圈可点:设定有趣新颖,规则自洽,借鉴了既有游戏套路又加了独有元素。但细看会发现,锯齿状前沿并没有完全消失。每一代 AI 都在长文本虚构上吃瘪。如果你常读 AI 写的东西,会在这里看到老问题:迷恋诡异感;过于复杂的点子却没完全落地;奇怪的比喻("天气和建筑是同一种论证的不同速度");太多华丽长句("当一片海忘记自己曾是路时,浮上来的神圣之物",一次很酷,一整本就累);每个角色都用同一种短促语调说话;以及那个名字"Mara"。所以,即便技术突飞猛进,毛边还在。
GPT-5.5 告诉我们:模型越来越聪明,应用越来越能干,框架越来越好,三者合力解决真实问题的能力越来越强。四个 prompt 拿一篇接近博士水平的论文,一个 prompt 拿一个能玩、带"实测"的桌游。但虚构依然扁平,假设有时无趣,哪怕统计是扎实的。尽管如此。一年前这些都还差得远,而最新这波发布,能力增益看起来在加速。
GPT-5.5 显然不是终点,但它是途中值得记一笔的一步。我写这个 newsletter 三年多了,规律没变:每隔几个月来一个新模型。我跑我的测试,原本不可能的事变容易,而每一轮的跨越都比上一轮更大。锯齿状前沿还在,只是比从前远得多了。
(原文配图为 GPT-5.5 自己选来做插图的一张图。)
砚数批注:给知识工作者的建议:模型、应用、框架三层正在拧到一起,Codex + GPT-5.5 + 图像生成器已经超出「聊天机器人」范畴。你是专家,AI 就是倍增器;你不是,它也帮不了太多。争议点:零幻觉只在狭窄任务成立,通用能力还远。
Mollick 没说但隐含的判断:三个层面的飞跃
仔细读这篇评测,Mollick 其实给出了三个独立的判断,每个都值得展开:
第一,模型层:GPT-5.5 是又一次「实质性的曲线向上」。不是参数翻倍那种线性提升,而是能做之前所有模型都做不到的事,比如 20 分钟完成 GPT-5.4 Pro 要 33 分钟的任务,且质量更高。速度和质量的同步跃升,说明底层架构在变。
第二,应用层:Codex 正在追上 Claude Code。OpenAI 从 Claude Code 学到了「桌面应用 + 智能体」的范式,Codex 现在能做真正实用的事,不只是生成代码片段,而是接管电脑完成复杂任务。
第三,工具层:新图像模型(GPT-imagegen-2)解决了文字渲染问题。能精确排版和出图的图像生成器,可以做 PPT、产品原型、示例网站,这是之前所有图像 AI 都做不到的。Mollick 的水獭测试从搞笑变成了实用,这就是质的飞跃。
三层叠加,意味着 GPT-5.5 不只是「又一个更强的模型」,而是「一个能力更完整的智能体平台」。从这层意义上看,Mollick 说「未来已来的信号」并不夸张。
砚数补注:Mollick 提到 GPT-5.5 Pro 的论文审阅能力,给整本 PDF 让它追 195 条参考文献,结果零幻觉。这个能力在学术圈的意义怎么强调都不过分。之前 LLM 最大的信任障碍就是幻觉,如果前沿模型能在特定任务上实现零幻觉,那学术出版、法律文书、医疗记录这些「零容错」领域将第一次真正对 AI 开放。但注意,这需要模型足够强 + 任务足够狭窄,不是通用能力。
砚数翻译
原文作者:Ethan Mollick
原文出处:One Useful Thing(Substack 专栏)
原文网址:https://www.oneusefulthing.org/p/sign-of-the-future-gpt-55
原文标题:Sign of the future: GPT-5.5
栏目:砚数 · 模型评测
砚数深度解析:砚数深度解析:锯齿状前沿对普通人的含义,是别再问这模型聪明吗,要问它在我的具体任务上处于哪个能力档。同一个 GPT-5.5,写博士论文能接受、编笑话却平淡,说明选型要看任务剖面而非平均分。国内团队做 AI 产品,也该从追榜单转向对齐具体工作流。
☆ 星标「砚数」,第一时间收到深度好文
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.