网易首页 > 网易号 > 正文 申请入驻

奥特曼被逼急:上线 o3-mini,甚至免费,网友:还是选DeepSeek

0
分享至

机器之心报道

机器之心编辑部

奥特曼能不急吗?

被 DeepSeek 狂轰乱炸了一周后,终于在今天发布了新的模型 o3-mini。

此次发布,o3-mini 包含 low、medium 和 high 三个版本。

OpenAI 表示,今天发布的 o3-mini 是其推理模型系列中最新、最具成本效益的模型,已上线 ChatGPT 和 API 。

我们打开 ChatGPT,o3-mini 和 o3-mini-high 两个新模型已然上线。

不过 o3-mini 目前还不支持视觉功能,因此开发者需要继续使用 OpenAI o1 进行视觉推理任务。

在使用权限上,ChatGPT Plus、Team 和 Pro 用户从今天起就可以访问 OpenAI o3-mini,企业版访问权限将在一周内开放。

作为此次升级的一部分,OpenAI 将 Plus 和 Team 用户的速率限制从 o1-mini 的每天 50 条消息提高到 o3-mini 的每天 150 条消息。此外,o3-mini 现在可以使用搜索功能,提供带有相关网络来源链接的最新答案。这是其在推理模型中整合搜索功能的早期原型。

从今天开始,免费用户也可以通过在消息编辑器中选择「推理」或重新生成响应来试用 OpenAI o3-mini。这是 OpenAI 首次向 ChatGPT 的免费用户提供推理模型。

虽然 OpenAI o1 仍然是更广泛使用的通用知识推理模型,但 OpenAI o3-mini 为需要精确性和速度的技术领域提供了专门的替代选择。在 ChatGPT 中,o3-mini 使用中等推理级别来提供速度和准确性之间的平衡。所有付费用户还可以在模型选择器中选择 o3-mini-high,从而获得需要更长时间生成响应但智能水平更高的版本。Pro 用户将可以无限制地访问 o3-mini 和 o3-mini-high。

对于此次发布,网友反馈如何?

知名播客主理人 Lex Fridman 表示,OpenAI o3-mini 虽然是一个很好的模型,但 DeepSeek r1 的性能相似,而且更便宜,并揭示推理过程。

他甚至给出了「DeepSeek moment」这样一个词形容 DeepSeek 带来的深远影响。

接下来,就让我们看下 o3-mini 的性能指标:

快速、强大且针对 STEM 推理优化

与其前身 OpenAI o1 类似,OpenAI o3-mini 针对 STEM 推理进行了优化。o3-mini-medium 在数学、编程和科学领域的表现与 o1 相当,同时响应速度更快。专家测试人员的评估显示,o3-mini 产生的答案比 o1-mini 更准确、更清晰,推理能力更强。测试人员在 56% 的情况下更偏好 o3-mini 的响应,并观察到 o3-mini 在困难的现实问题上重大错误减少了 39%。o3-mini-medium 在一些最具挑战性的推理和智能评估(包括 AIME 和 GPQA)上与 o1 的表现相当。

竞赛数学(AIME 2024):

竞赛数学:o3-mini-low 与 o1-mini 的表现相当。o3-mini-medium 达到与 o1 相当的表现。o3-mini-high 超过了 o1-mini 和 o1,上图中灰色阴影区域为 64 个样本的多数投票(共识)。

博士级科学问题(GPQA Diamond):

博士极科学问题:o3-mini-low 的表现优于 o1-mini。o3-mini-high 的表现与 o1 相当,在博士级生物学、化学和物理问题上都显示出显著进步。

研究级数学(FrontierMath):

研究级数学:o3-mini-high 在 FrontierMath 上的表现优于其前代产品。使用 Python 工具时,o3-mini-high 能够在首次尝试时解决超过 32% 的问题,包括超过 28% 的具有挑战性的(T3)问题。

竞赛编程(Codeforces):

在 Codeforces 编程中, o3-mini 随着推理努力级别的提高获得了越来越高的 Elo 分数,均优于 o1-mini。o3-mini-medium 达到了与 o1 相当的表现。

软件工程(SWE-bench Verified):

软件工程:o3-mini 是 OpenAI 发布的在 SWEbench-verified 上表现最好的模型。o3-mini-high 使用开源 Agentless 框架可达到 39% 的准确率,使用内部工具可达到 61% 的准确率。

LiveBench 编码:

LiveBench 编码:即便是 o3-mini-medium 也超过了 o1-high,突显了其在编码任务中的效率。o3-mini-high 进一步扩大了领先优势,在关键指标上取得了显著更强的表现。

普通知识问题:

普通知识问题:o3-mini 在各个一般性知识领域的评估中都优于 o1-mini。

人类偏好评估:

人类偏好评估:外部专家测试人员的评估显示, o3-mini 产生的答案比 o1-mini 更准确、更清晰,推理能力更强,特别是在 STEM 领域。测试人员在 56% 的情况下更偏好 o3-mini 的响应,并观察到 o3-mini 在困难的现实问题上重大错误减少了 39%。

模型速度和性能

o3-mini 在保持与 OpenAI o1 相当的智能水平的同时,提供了更快的性能和更高的效率。除了上述 STEM 评估外,o3-mini-medium 的其他数学和事实性评估中也展现出优越的结果。在 A/B 测试中,o3-mini 的响应速度比 o1-mini 快 24%,平均响应时间为 7.7 秒,而 o1-mini 为 10.16 秒。

延迟:o3-mini 的首个 token 生成时间平均比 o1-mini 快 2500 毫秒。

安全

OpenAI 教导 o3-mini 安全响应的主要技术之一是审慎对齐(deliberative alignment),这种对齐方式训练模型在回答用户提示之前,先对人工编写的安全规范进行充分的思考和推理。与 OpenAI o1 类似,研究人员发现 o3-mini 在具有挑战性的安全性和越狱评估上显著超越了 GPT-4o。在部署之前,OpenAI 使用了与 o1 相同的准备方法、外部红队测试和安全性评估来仔细评估 o3-mini 的安全风险。

违规内容评估结果

越狱评估结果

未来展望

OpenAI o3-mini 的发布标志着 OpenAI 在推进高性价比智能方面又迈出了一步。通过优化 STEM 领域的推理能力,同时保持低成本,OpenAI 正在使高质量 AI 变得更加容易获取。该模型延续了其降低智能成本的记录 —— 自 GPT-4 推出以来,每个 token 的定价降低了 95%—— 同时保持顶级推理能力。随着 AI 应用的扩展,OpenAI 仍然致力于在前沿领域引领,构建即使在大规模部署和使用的情况下,也能保持智能、效率与安全平衡的模型。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
大家发现问题没有,美国想揍哪一个国家,如果俄罗斯不插手,或者不帮助,这个国家大概率会被揍。

大家发现问题没有,美国想揍哪一个国家,如果俄罗斯不插手,或者不帮助,这个国家大概率会被揍。

回京历史梦
2026-10-06 16:50:48
35岁黄仁勋女儿低调结婚,老公竟是“男版谷爱凌”?入职岳父公司两年升副总裁…

35岁黄仁勋女儿低调结婚,老公竟是“男版谷爱凌”?入职岳父公司两年升副总裁…

商务范
2026-10-11 15:18:21
王蔷现状:退役9个月还坚持打球,嫁网球帅哥仍未育,34岁更美了

王蔷现状:退役9个月还坚持打球,嫁网球帅哥仍未育,34岁更美了

笑饮孤鸿非
2026-08-14 21:57:54
马斯克已明确表示:SpaceXAI官方账号正式更名为“SpaceXSI(超级智能)”;特朗普此前发出警告,不使用这个词的人就是敌人

马斯克已明确表示:SpaceXAI官方账号正式更名为“SpaceXSI(超级智能)”;特朗普此前发出警告,不使用这个词的人就是敌人

吉刻新闻
2026-10-11 21:06:32
《史记》20句名言,充满智慧,受益终生!

《史记》20句名言,充满智慧,受益终生!

国学杂谈
2024-11-07 18:33:26
外媒:“阵风”近距空战比歼-16强,埃及飞行员,对歼-16和PL-15导弹表示赞赏

外媒:“阵风”近距空战比歼-16强,埃及飞行员,对歼-16和PL-15导弹表示赞赏

蓝星杂谈
2026-10-11 21:47:14
快讯!魏德尔的选择党传来消息!

快讯!魏德尔的选择党传来消息!

故事终将光明磊落
2026-10-11 09:48:12
直冲热搜!周杰自曝10年来每天只吃一顿饭!网友吵翻了,普通人能照搬吗?

直冲热搜!周杰自曝10年来每天只吃一顿饭!网友吵翻了,普通人能照搬吗?

91.6陕西交通广播
2026-10-10 09:12:14
深挖苏联鼠疫武器遗产:为什么俄罗斯至今保留顶级鼠疫绝密研究所

深挖苏联鼠疫武器遗产:为什么俄罗斯至今保留顶级鼠疫绝密研究所

生活新鲜市
2026-10-09 09:18:54
车祸瘫痪后,被妻子扔养老院22年,昔日的“歌王”如今怎么样了?

车祸瘫痪后,被妻子扔养老院22年,昔日的“歌王”如今怎么样了?

牛牛叨史
2025-11-22 01:44:59
10月喜事扎堆!3大生肖贵人贴身相助,事业节节攀升,财运一路狂飙

10月喜事扎堆!3大生肖贵人贴身相助,事业节节攀升,财运一路狂飙

人閒情事
2026-10-11 14:27:05
全球也就20例!巴西一名19岁女子,在同一个夜晚与两位男性有过亲密接触,怀孕生下双胞胎后,竟意外发现两个孩子的生父并非同一人

全球也就20例!巴西一名19岁女子,在同一个夜晚与两位男性有过亲密接触,怀孕生下双胞胎后,竟意外发现两个孩子的生父并非同一人

扶苏聊历史
2026-10-10 11:04:50
杜兰特:76人现在有10个人可以防对面明星球员,当年勇士可没有

杜兰特:76人现在有10个人可以防对面明星球员,当年勇士可没有

懂球帝
2026-10-11 01:51:09
我退休金4000,每天的生活就是躺平,感觉有点无聊,想上班又怕累,好纠结

我退休金4000,每天的生活就是躺平,感觉有点无聊,想上班又怕累,好纠结

蝉吟槐蕊
2026-10-11 22:52:07
为什么傅斯年认为,苏联模式是集人类文明中罪恶之大成?

为什么傅斯年认为,苏联模式是集人类文明中罪恶之大成?

听雪禅
2026-10-06 17:25:10
李玉刚宣布:今后任何歌手在演唱会上演唱《万疆》,永久免费授权

李玉刚宣布:今后任何歌手在演唱会上演唱《万疆》,永久免费授权

草莓解说体育
2026-10-10 03:44:47
咸鱼涉黄:“夜总会”不会消失,但会转移

咸鱼涉黄:“夜总会”不会消失,但会转移

梁欢欢的理智与情感
2026-09-22 11:04:57
密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

上海约饭局
2026-09-19 10:42:08
被喜茶新工服笑不活了,网友:喜之螂!

被喜茶新工服笑不活了,网友:喜之螂!

广告案例精选
2026-10-10 14:08:22
出现这1种面相,可能是肿瘤前兆!别以为只是变丑了

出现这1种面相,可能是肿瘤前兆!别以为只是变丑了

39健康网
2026-10-10 17:31:06
2026-10-12 00:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14173文章数 142748关注度
往期回顾 全部

科技要闻

卸任CEO后,苹果董事长库克再度到访中国

头条要闻

父亲放鞭炮祝贺女儿离婚:你平安回来 家就是完整的

头条要闻

父亲放鞭炮祝贺女儿离婚:你平安回来 家就是完整的

体育要闻

30天30队·魔术:班凯罗最后的试炼?

娱乐要闻

没夫妻生活咋办?冉莹颖绝不求邹市明

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

大6座插混SUV新选择 阿维塔T09概念版亮相巴黎车展

态度原创

教育
亲子
艺术
房产
本地

教育要闻

“燃灯者”宋国安:灯火长明 纸短情长

亲子要闻

小孩哥不小心碰到旁边同学,下意识轻轻补救,小小年纪就懂得顾及别人的感受

艺术要闻

被无数美院生私藏的人体写生大神!笔下的人体,美得刚刚好还超现实!

房产要闻

三亚市区,200万级六层真洋房 真香!

本地新闻

踏访沙县第一村,寻国民小吃本源

无障碍浏览 进入关怀版