网易首页 > 网易号 > 正文 申请入驻

重磅!OpenAI推o3-mini新模型,被DeepSeek逼急?定价仍打不过

0
分享至


智东西
作者 ZeR0
编辑 漠影

智东西2月1日报道,今日凌晨,OpenAI发布全新推理模型o3-mini

OpenAI称这是其最具成本效益的推理模型,复杂推理和对话能力显著提升,在科学、数学、编程等领域的性能表现超过前代o1模型,同时保持了o1-mini的低成本和低延迟,并可与联网搜索功能搭配使用


o3-mini已在ChatGPT和API中可用,企业版访问权限将在一周内推出。

显然DeepSeek登顶美国App Store免费榜给OpenAI制造了压力。今天,ChatGPT首次向所有用户免费提供推理模型:用户可在ChatGPT中选择“Reason”按钮来试用o3-mini。


ChatGPT Pro用户可无限制访问,Plus和Team用户的速率限制从原来o1-mini的每天50条消息增加3倍到o3-mini的每天150条消息

付费用户还可以选择更高智能的版本“o3-mini-high”。该版本需要更长的时间才能生成响应。


和o1模型一样,o3-mini模型的知识截止日期为2023年10月,上下文窗口为20万个token,最多可输出10万个token。

有低(low)、中(medium)、高(high)三个版本的o3-mini,供开发者针对其特定用例进行优化。

o3-mini目前不支持视觉功能,因此开发者仍需使用o1进行视觉推理任务。

即日起,o3-mini在Chat Completions API、Assistants API、Batch API中推出。

OpenAI称相较推出GPT-4时,每个token的价格已经降低了95%,同时保持了顶级的推理能力。不过o3-mini的API定价还是高于DeepSeek模型。


▲OpenAI模型与DeepSeek模型API定价对比(智东西制图)

安全方面,OpenAI发现o3-mini在具有挑战性的安全性和越狱方面明显超过GPT-4o。

一、详解o3-mini:科学数学编程能力进化,延迟明显降低

OpenAI发布了o3-mini的37页详细报告,涵盖模型的介绍、数据和训练、测试范围、安全挑战和评估、外部红队测试、准备框架评估、多语言性能以及结论等多个方面。

o3-mini针对科学、数学、编程推理进行了优化,同时响应速度更快。

该模型在GPQA Diamond(理化生)、AIME 2022-2024(数学)、Codeforces ELO(编程)基准测试中,o3-mini的分数分别为0.77、0.80、2036,比肩或超过o1推理模型。


在14种语言的MMLU测试集上,o3-mini的表现显著优于o1-mini,展示了其在多语言理解方面的进步。


外部专家测试人员的评估表明,与o1-mini相比,o3-mini的答案更准确、更清晰,推理能力更强。

在人类偏好评估中,测试人员在56%的时间里更喜欢o3-mini的回答,并观察到在困难的现实问题上重大错误减少了39%。在中推理能力下,o3-mini在一些最具挑战性的推理和智力评估(包括AIME和GPQA)上的表现与o1相当。

o3-mini的智能可媲美o1,提供了更快的性能、更高的效率。中推理能力下,该模型还在额外的数学和事实性评估中表现出色。在A/B测试中,o3-mini的响应速度比o1-mini快24%,平均响应时间为7.7秒,而o1-mini为10.16秒。



数学方面,在低推理能力下,o3-mini的表现与o1-mini相当,而在中推理能力下,o3-mini的表现与o1相当。同时,在高推理能力下,o3-mini的表现优于o1-mini和o1。



具有高推理能力的o3-mini在FrontierMath上的表现优于其前代。

在FrontierMath测试上,当被提示使用Python工具时,具有高推理能力的o3-mini在第一次尝试时解决了超过32%的问题,其中包括超过28%的具有挑战性的(T3)问题。

o3-mini随着推理能力的增加逐渐获得更高的Elo分数,均优于o1-mini。在中推理能力下,它的表现与o1相当。



o3-mini是OpenAI在SWE-bench验证中表现最好的模型。


关于SWE-bench验证结果的更多数据如下图所示。o3-mini (tools) 性能最好,为61%。使用Agentless而非内部工具的o3-mini上市候选产品得分为39%。o1是表现第二好的模型,得分为48%。


在LiveBench编程测试中,高推理能力的o3-mini得分全面超过o1-high。


二、多项安全评估超过GPT-4o

OpenAI还详细介绍了o3-mini在多个安全评估中的表现,称o3-mini在具有挑战性的安全性和越狱评估方面明显超越了GPT-4o。

在不允许的内容评估中,与GPT-4o相比,o3-mini在标准拒绝评估和挑战性拒绝评估中表现相似,但在XSTest中略逊一筹。


在越狱评估中,o3-mini与o1-mini相比,在生产越狱、越狱增强示例、StrongReject和人类来源的越狱评估中表现相当。


在幻觉评估中,使用PersonQA数据集,o3-mini的准确率为21.7%,幻觉率为14.8%,与GPT-4o、o1-mini相比表现相当或更好。


在公平性和偏见评估中,o3-mini在BBQ评估中的表现与o1-mini相似,但在处理模糊问题时的准确性略有下降。


外部红队测试显示,o3-mini在与o1的比较中表现相当,两者都显著优于GPT-4o。


在Gray Swan Arena的越狱测试中,o3-mini的平均用户攻击成功率为3.6%,与o1-mini和GPT-4o相比略高。

准备框架评估涵盖了网络安全、CBRN(化学、生物、放射性、核)、说服力、模型自主性四个风险类别。o3-mini在网络安全方面被评为“低风险”,在CBRN、说服力、模型自主性方面被评为“中等风险”,在生物威胁创建方面的表现达到了“中等风险”阈值,但在核和放射性武器发展方面的能力有限。

按其评级,只有缓解后得分为“中等”或以下的模型才可以部署,得分“高等”或以下的模型才可以进一步开发。

三、o3基准测试成本或超3000万美元,OpenAI正谈判2900亿元新融资

自去年9月发布o1以来,OpenAI一直在迭代其推理模型,去年年底发布的o3模型是其最新一代AI推理模型。

高端版o3模型针对高计算应用,而o3-mini迎合了需要兼顾经济高效的用户需求。这反映了OpenAI试图平衡可访问性和高级付费产品的策略。

这两天也不知道是被DeepSeek逼急了,还是为了给o3-mini预热,OpenAI联合创始人兼CEO萨姆·阿尔特曼在社交平台上非常活跃,又是夸DeepSeek R1令人印象深刻,又说OpenAI将提供更好的模型,又强调更多计算很重要。

昨天他还大张旗鼓地宣布第一个完整8机架GB200 NVL72服务器正在微软Azure为OpenAI运行。


印度政府本周五发布的《2024-2025经济调查》报告显示,OpenAI可能已经花费超过3000万美元来对其最新AI推理模型o3进行基准测试。

该报告写道,OpenAI o3模型处理能力的突破付出了非常高的代价。ARC-AGI基准测试被认为是最具挑战性的AI任务之一,OpenAI的低效配置模型导致了20万美元的成本。高效模型的成本更是高达低效模型的172倍,也就是大约3440万美元


阿尔特曼前几天还晒出和微软董事长兼CEO萨提亚·纳德拉的合照,说微软和OpenAI合作的下一阶段将会比任何人想象的都要好得多。


不过微软作为OpenAI最大投资者的名号,可能要被日本软银集团夺走。

近期软银集团创始人兼CEO孙正义与阿尔特曼往来愈发密切,上周宣布联手成立AI巨型项目“星际之门(Stargate)”,未来四年投资5000亿美元(约合人民币3.6万亿元)建设AI基础设施,昨天又被外媒曝出将成为OpenAI新一轮巨额融资的领投方。

据外媒报道,OpenAI正在进行初步谈判,计划在一轮融资中筹集至多400亿美元(约合人民币2901亿元),估值将达到3000亿美元(约合人民币2.18万亿元)。日本软银集团将领投此轮融资,正在商谈投资150亿至250亿美元,剩余资金将来自其他投资者。

加上之前软银承诺向“星际之门”投资的逾150亿美元,最终软银可能会在与OpenAI的合作上投入超过400亿美元。这将成为软银迄今最大的投资之一。

结语:狂卷性价比,高质AI推理模型走向普及

此前马斯克等科技大佬已经公开质疑过如何承担建造“星际之门”的巨额成本。在DeepSeek高性能低成本开源模型的影响下,美国AI产业界和华尔街投资者对OpenAI等其他美国AI开发商的大手笔支出策略更是疑窦丛生。

OpenAI最新推出的o3-mini,也被视作抵御DeepSeek模型冲击的最新举措,令业界尤其关注。

在新闻稿中,OpenAI称o3-mini的发布标志着该公司向突破高性价比智能界限的使命又迈进了一步,让高质量的AI更加触手可及,OpenAI致力于走在前沿,构建能够平衡智能、效率和安全性的大规模模型。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一碗米饭六碗菜,张雪峰这顿饭,藏着他透支身体的真相

一碗米饭六碗菜,张雪峰这顿饭,藏着他透支身体的真相

王二哥老搞笑
2026-03-25 20:09:31
马筱梅眼含泪水回应!买房真因不是自私,汪小菲第一次和张兰同队

马筱梅眼含泪水回应!买房真因不是自私,汪小菲第一次和张兰同队

潮鹿逐梦
2026-03-24 13:13:55
侃爷夫妇出街画风猎奇 比安卡银裤辣眼引围观

侃爷夫妇出街画风猎奇 比安卡银裤辣眼引围观

述家娱记
2026-03-23 19:46:51
为啥没第二人称射击游戏,因为玩过的人都疯了

为啥没第二人称射击游戏,因为玩过的人都疯了

街机时代
2026-03-25 16:55:54
宁向美国妥协,也不求助中国?俄罗斯到底在布什么局?

宁向美国妥协,也不求助中国?俄罗斯到底在布什么局?

Hi科普啦
2026-03-26 14:13:23
40分钟连挨4轮导弹!以色列遭盟友背叛?中方:支持巴勒斯坦建国

40分钟连挨4轮导弹!以色列遭盟友背叛?中方:支持巴勒斯坦建国

甜柠聊史
2026-03-26 14:38:54
男子干活时摔成高位截瘫,妻子一看男子不能赚钱养家了,丢下男子和6岁的女儿跑了

男子干活时摔成高位截瘫,妻子一看男子不能赚钱养家了,丢下男子和6岁的女儿跑了

张晓磊
2026-03-26 11:22:06
不装了摊牌了!白宫承认伊朗拒绝谈判,特朗普准备“释放地狱”!

不装了摊牌了!白宫承认伊朗拒绝谈判,特朗普准备“释放地狱”!

阿芒娱乐说
2026-03-26 14:19:21
越来越多的人查出肠癌!医生含泪苦劝:冰箱久置的这4物是帮凶

越来越多的人查出肠癌!医生含泪苦劝:冰箱久置的这4物是帮凶

岐黄传人孙大夫
2026-03-17 23:25:03
白宫:美国总统特朗普将于5月访华

白宫:美国总统特朗普将于5月访华

辇毂
2026-03-26 05:18:40
谷歌新算法引发美股存储板块集体下挫

谷歌新算法引发美股存储板块集体下挫

金融界
2026-03-26 09:37:28
女儿高考当天,我撞见婆婆往她汤里下药,我偷偷换给了高考的侄子

女儿高考当天,我撞见婆婆往她汤里下药,我偷偷换给了高考的侄子

鱼语昱雨轩
2026-03-25 14:03:47
国民党大乱!马英九紧急发声,郑丽文下场开骂:扯破脸、斗到底!

国民党大乱!马英九紧急发声,郑丽文下场开骂:扯破脸、斗到底!

闻香阁
2026-03-26 03:33:51
2020年女子当众扇儿子耳光,儿子直接跳楼,如今女子已自杀身亡

2020年女子当众扇儿子耳光,儿子直接跳楼,如今女子已自杀身亡

观察鉴娱
2026-03-18 09:09:10
难以置信!一福建男子称,感谢失业后妻子和他离婚,帮他减轻压力

难以置信!一福建男子称,感谢失业后妻子和他离婚,帮他减轻压力

火山詩话
2026-03-20 09:50:39
美国懵了,能摧毁伊朗电力的石墨炸弹,竟让中国两座城市联手废了

美国懵了,能摧毁伊朗电力的石墨炸弹,竟让中国两座城市联手废了

瑛派儿老黄
2026-03-25 23:46:07
真撑不住了!特朗普,要做重大让步了!

真撑不住了!特朗普,要做重大让步了!

大嘴说天下
2026-03-25 19:16:47
王励勤动真格了!伦敦世乒赛阵容有变,陈梦调整,2人被冷落

王励勤动真格了!伦敦世乒赛阵容有变,陈梦调整,2人被冷落

不似少年游
2026-03-25 17:03:59
美内政部长称美国从委内瑞拉“带回”价值1亿美元黄金,引巨大争议

美内政部长称美国从委内瑞拉“带回”价值1亿美元黄金,引巨大争议

环球网资讯
2026-03-26 14:54:16
奇瑞回应48%热效率争议,顺带下战书:定会做成,油耗低至1L

奇瑞回应48%热效率争议,顺带下战书:定会做成,油耗低至1L

明镜pro
2026-03-26 09:22:44
2026-03-26 15:36:49
智东西 incentive-icons
智东西
聚焦智能变革,服务产业升级。
11433文章数 117015关注度
往期回顾 全部

科技要闻

Meta高管狂分百亿期权,700名员工却下岗

头条要闻

担心特朗普突然停战 以总理下令48小时尽力摧毁伊设施

头条要闻

担心特朗普突然停战 以总理下令48小时尽力摧毁伊设施

体育要闻

35岁替补门将,凭什么入选英格兰队?

娱乐要闻

张雪峰家人首发声 不设追思会丧事从简

财经要闻

黄仁勋:芯片公司的时代已经结束了

汽车要闻

一汽奥迪A6L e-tron开启预售 CLTC最大续航815km

态度原创

手机
旅游
家居
公开课
军事航空

手机要闻

存储涨价苦了国产品牌、普通消费者,苹果却不受影响

旅游要闻

淡季旺销!南明住宿业今年前两月营收斩获1.18亿元

家居要闻

傍海而居 静观蝴蝶海

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

担心特朗普突然停战 以总理下令48小时尽力摧毁伊设施

无障碍浏览 进入关怀版