OpenAI的Sam Altman在社交平台上给出了一组关于模型数学能力的对比。他把GPT-5.5和GPT-5.6放在同一个坐标系里衡量,参照物不是其他AI,而是人类数学教授。
按照他的说法,GPT-5.5大约相当于一位普通数学教授的水平,而GPT-5.6则相当于排名前1%到2%的顶尖教授。这个跨度只隔了一个版本号。
![]()
比顶尖教授更强的内部模型
Altman还提到了一个尚未公开的内部模型。他表示,代号在Astra之后的这个内部模型,能够做到一些即使是最优秀的数学家也做不到的事情。
这句话的信息量在于参照系的切换。前两个版本对标的是人类教授群体中的不同位置,而内部模型对标的是"最好的数学家也做不到的事"——已经超出了现有的人类能力刻度。
他没有说明这个内部模型具体能做什么,也没有给出时间表。
数学为什么跑得这么快
Altman对数学这个领域的判断是:它经历了一次异常快速的起飞。他补充说,无论用几乎任何一种定义来衡量,这都算得上是一次快速起飞。
这个表述值得注意的地方在于"by almost any definition"这个限定。他没有只挑一个对自己有利的指标,而是说几乎所有定义下都成立。
数学之所以成为观察AI能力跃迁的窗口,和这个领域本身的可验证性有关。数学问题的答案对错分明,模型输出可以直接检验,这让能力提升更容易被量化和对比。Altman选择用数学教授作为标尺,也是因为这条标尺相对清晰。
一个版本号,一个能力层级
把Altman的原话拆开看,他实际上画了一条三级阶梯:
- GPT-5.5:普通数学教授水平
- GPT-5.6:顶尖1%到2%数学教授水平
- Astra之后的内部模型:超出最好数学家的能力范围
从"普通教授"到"前2%教授",中间只隔了一个小版本号。而从"前2%教授"到"最好数学家也做不到",隔的是一个尚未发布的内部模型。
这条阶梯的两端差距,是Altman这段话里最容易被忽略的部分。他没有说GPT-5.6已经触及天花板,反而明确指向了天花板之上还有东西。
没有给出的部分
这条动态里没有基准测试分数,没有具体数学问题的案例,也没有内部模型的发布时间。Altman给出的全部是相对位置的描述,而不是绝对能力的量化。
对于关注模型能力曲线的人来说,这种表述方式本身也是一种信息:能力对比的参照物正在从"和其他模型比"转向"和人类专家比",再转向"和人类能力的上限比"。
数学领域的这次"快速起飞",Altman用了两次强调。一次是陈述事实,一次是补充定义。这种重复在一条简短的动态里并不常见。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.