网易首页 > 网易号 > 正文 申请入驻

突发!OpenAI发布最强模型o1:博士物理92.8分,IOI金牌水平

0
分享至

梦晨 衡宇 发自 凹非寺
量子位 | 公众号 QbitAI

来了来了!刚刚,OpenAI新模型无预警上新:

o1系列,可以进行通用复杂推理,每次回答要花费更长时间思考。

在解决博士水平的物理问题时,GPT-4o还是“不及格”59.5分,o1一跃来到“优秀档”,直接干到92.8分

没错,传说中的「草莓」,终于来与大家见面了!

CEO奥特曼称它是一种新范式的开始:可以进行通用复杂推理的人工智能。

具体来说,o1系列是OpenAI首个经过强化学习训练的模型,在输出回答之前,会在产生一个很长的思维链,以此增强模型的能力。

换句话说,内部思维链越长,o1思考得越久,模型在推理任务上的表现就越好。

o1有多强呢?CEO奥特曼直给了答案:

在刚刚结束的2024 IOI信息学奥赛题目中,o1的微调版本在每题尝试50次条件下取得了213分,属于人类选手中前49%的成绩。

如果允许它每道题尝试10000次,就能获得362.14分,高于金牌选手门槛,可获得金牌

另外它还在竞争性编程问题(Codeforces) 中排名前89%,在美国数学奥林匹克(AIME) 预选赛题目中跻身美国前500名学生之列。

与GPT-4o相比,o1在数理化生、英语法律经济等各种科目都有不同成绩改进。

汇总官方发布的各种消息来看,这次突然发布的o1系列又分为三个型号:

o1,新的大模型天花板,过于强大目前不方便对外公开。

o1-preiview,o1的早期版本,可以立即提供给ChatGPT付费用户和API用户

o1-mini,速度更快、性价比更高,适用于需要推理和无需广泛世界知识的任务。

不少OpenAI员工都分别用“系统1”和“系统2”思考来科普o1系列与之前模型的区别。

连长期休假中的总裁Brockman都“诈尸”回归了。

思维链提示方法的原作者Jason Wei表示,这一次不是纯粹通过提示来完成思维链,而是使用强化学习训练模型以更好地执行链式思考。

在深度学习的历史中,人们一直试图扩展训练阶段的计算,但思维链是自适应计算的一种形式,现在也可以在推理时扩展。

新模型做了很多类似人类的事情,比如将棘手的步骤分解为更简单的步骤、识别和纠正错误以及尝试不同的方法。
游戏已被完全重新定义。

o1:AI能力新天花板

通过训练,o1模型学会完善自己的思维过程,尝试不同的策略,并认识到自己的错误。

不过作为早期模型,它尚不具备ChatGPT的许多有用功能,例如联网搜索以及上传文件和图像。

但对于复杂的推理任务来说,这是一个重大进步,OpenAI称代表了人工智能的最高水平。

鉴于此,他们决定将计数器重置,并将该系列模型命名为OpenAI o1

随着更多的强化学习(训练时计算)和更多的思考时间(测试时计算),o1 的性能持续提高,新的Scaling Law诞生了

不过这种方法的Scaling受到的限制与普通预训练有很大不同,OpenAI正在继续研究它们。

o1思考起来是什么样子?可以从官网示例中的编写Bash脚本的编程任务一窥究竟。

首先作为对比,GPT-4o会直接就开始写代码,遗憾得到错误结果

而o1-preiview会先用自己的理解复述一遍要求,然后开始拆解要求明确最终目标

接下来它会给自己定义任务分析限制条件列出需要用到的方法

进一步把任务拆解成明确的数个小步骤。

最后才动手编写代码,并保证一次性得到正确结果。

OpenAI表示,o1系列可以帮医疗保健研究人员来注释细胞测序数据,帮助物理学家可以生成量子光学所需的复杂数学公式,所有领域的开发人员可以使用o1来构建和执行多步骤工作流程。

而且不是说说而已,OpenAI已经邀请相关的人类专家学者试用了一波。

马克思普朗克研究所的量子物理学者Mario Krenn,展示了GPT-4o不能回答但o1-preview正确完成计算的复杂量子物理问题。

除了考试和学术基准之外,团队还评估了人们对o1-preview与GPT-4o在开放问题上的偏好。

在数据分析、编码和数学等推理密集型类别中,o1-preview明显优于gpt-4o。

然而o1-preview在某些自然语言任务上并不是首选,这表明它并不适合所有场景。

OpenAI科学家Noam Brown分享了更详细的个人测试结果。

在上个月的ACL会议上有一个所有当时大模型都无法解决的逻辑难题。o1-preview能够做对,o1满血版几乎每次尝试都能做对。

目前o1花费在思考上的时间是几秒到十几秒,但OpenAI未来的改进方向不是缩短,反而是努力增加这个时间,

目标是让未来的版本思考几个小时、几天甚至几周。
推理成本会更高,但你会为一种新的抗癌药物付多少钱?为了电池的突破、黎曼猜想的证明又付多少?
人工智能可以不仅仅是聊天机器人

谁可以访问o1?

根据OpenAI官方说法,ChatGPT Plus和Team用户最早可在几个小时内可以体验到o1系列模型。

在发布时,o1-preview限制为每周30条消息,o1-mini每周50条。

API访问权限将首先给Tier 5级用户,也就是已经在OpenAI API上花费超过1000美元的人。

OpenAI正在努力提高这些速率,并使ChatGPT能够针对给定的提示自动选择合适的模型。

快打开ChatGPT看看你是不是第一波吃草莓的人吧。

https://openai.com/o1/

https://x.com/polynoamial/status/1834280155730043108

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
人伦大乱,正在悄悄毁掉无数中国家庭!看似平常,实则家道衰落

人伦大乱,正在悄悄毁掉无数中国家庭!看似平常,实则家道衰落

游戏收藏指南
2026-06-30 06:31:39
2年4000万!波尔津吉斯降薪续约勇士 过去3季仅出场116场

2年4000万!波尔津吉斯降薪续约勇士 过去3季仅出场116场

醉卧浮生
2026-06-30 06:57:48
网友笃定她家黑狗是金毛,大家都不信,直到她晒出这张照片……没毛病,是金毛!

网友笃定她家黑狗是金毛,大家都不信,直到她晒出这张照片……没毛病,是金毛!

爱宠物
2026-06-30 01:01:40
走面风波升级,“一言不发”的冯小刚,终于不再顾及所谓的体面!

走面风波升级,“一言不发”的冯小刚,终于不再顾及所谓的体面!

曹莽看世界
2026-06-30 08:31:19
高考数学唯一满分男生被清华录取,网友担心他去美国,答案很现实

高考数学唯一满分男生被清华录取,网友担心他去美国,答案很现实

娱乐E君
2026-06-26 18:07:56
原来他是迟蓬的丈夫,是我们熟悉的资深大导演,公公是电影明星

原来他是迟蓬的丈夫,是我们熟悉的资深大导演,公公是电影明星

仙味少女心
2026-06-29 12:37:47
应采儿坦言58岁陈小春跑商演倍感疲惫,俩儿子年学费近百万,网友直言:不来大陆港星难扛家庭重担

应采儿坦言58岁陈小春跑商演倍感疲惫,俩儿子年学费近百万,网友直言:不来大陆港星难扛家庭重担

背包旅行
2026-06-27 14:42:54
韩媒:叫嚣世界杯夺冠的日本队淘汰赛再次一轮游!

韩媒:叫嚣世界杯夺冠的日本队淘汰赛再次一轮游!

随波荡漾的漂流瓶
2026-06-30 05:42:34
定了!双控卫留队,火箭新阵容出炉:12人进大名单,伊森去留难定

定了!双控卫留队,火箭新阵容出炉:12人进大名单,伊森去留难定

熊哥爱篮球
2026-06-30 13:18:49
德天空民调:93%德国球迷支持解雇纳格尔斯曼 84%认为进球应有效

德天空民调:93%德国球迷支持解雇纳格尔斯曼 84%认为进球应有效

云隐南山
2026-06-30 10:57:07
高分学子成试验品?福耀科大风波发酵,网友:张雪峰的含金量上升

高分学子成试验品?福耀科大风波发酵,网友:张雪峰的含金量上升

火山詩话
2026-06-27 16:12:32
韩红,请说到做到:退出公益,注销基金会,别“又哭又闹又出发”

韩红,请说到做到:退出公益,注销基金会,别“又哭又闹又出发”

八桂知事
2026-06-29 23:32:05
喜茶给新店围挡挖洞,“每天洞都大一点点”

喜茶给新店围挡挖洞,“每天洞都大一点点”

Vista氢商业
2026-06-29 23:22:10
贝克汉姆14岁的女儿小七怎么如此成熟了,好像少妇

贝克汉姆14岁的女儿小七怎么如此成熟了,好像少妇

西楼知趣杂谈
2026-06-13 19:52:21
没钱了?西蒙斯重返NBA!主动示好热火队

没钱了?西蒙斯重返NBA!主动示好热火队

篮球教学论坛
2026-06-30 12:55:37
卢卡申科闪电式访问中国,他不是信不过普京,就怕俄罗斯有心无力

卢卡申科闪电式访问中国,他不是信不过普京,就怕俄罗斯有心无力

共工之锚
2026-06-30 00:15:01
暴怒!韩国球迷接机破口大骂:杂种洪明甫毁了世界杯!李刚仁看呆了

暴怒!韩国球迷接机破口大骂:杂种洪明甫毁了世界杯!李刚仁看呆了

818体育
2026-06-30 11:36:10
Lisa回到韩国,但无任何粉丝去接机,韩国网友希望她摘到KPOP标签

Lisa回到韩国,但无任何粉丝去接机,韩国网友希望她摘到KPOP标签

芊手若
2026-06-30 09:13:22
丘吉尔曾言:如果不是被原子弹炸过,日本这个国家可能就不存在了

丘吉尔曾言:如果不是被原子弹炸过,日本这个国家可能就不存在了

掠影后有感
2026-06-30 09:40:38
特斯拉摆出爆炸件,用来炫耀供应链?

特斯拉摆出爆炸件,用来炫耀供应链?

虎嗅APP
2026-06-29 23:02:30
2026-06-30 13:31:00
量子位 incentive-icons
量子位
追踪人工智能动态
12866文章数 176508关注度
往期回顾 全部

科技要闻

DeepSeek V4正式版要来 高峰期API价格翻倍

头条要闻

安徽女子在酒吧被陌生男子投放"伟哥" 警方不予立案

头条要闻

安徽女子在酒吧被陌生男子投放"伟哥" 警方不予立案

体育要闻

日本众将掩面痛哭 连续3届先破门却被逆转

娱乐要闻

韩红称要退出公益,多位名人挽留

财经要闻

韩国万亿"芯"基建:存储能否成AI时代油田

汽车要闻

谁懂啊家人们!爹味和班味一点都没,这台底盘最硬国产大猎装太上头!

态度原创

时尚
教育
旅游
数码
本地

“复古波点”又流行回来了!夏天简单穿就很时髦

教育要闻

原来好的教育藏在威海这里,“六立一达”养出眼里有光的孩子!#观威海

旅游要闻

夏日出游升温,小红书助力文旅商家抢赢暑期

数码要闻

英伟达4600颗最强GPU登陆微软:单卡288GB显存+37TB统一内存池

本地新闻

贵州小城的新目标:举办“村超”世界杯!

无障碍浏览 进入关怀版