网易首页 > 网易号 > 正文 申请入驻

应战DeepSeek, OpenAI紧急上线o3-mini!价格打骨折,免费用户也能用

0
分享至

扫码加 FP 企微,暗号 DeepSeek 进群

文章转载自「新智元」。

o3-mini,真的来了。

刚刚,OpenAI官宣o3-mini和o3-mini-high两大版本正式在ChatGPT上线。

诚如奥特曼所言,免费用户直接打开「Reason」即可体验,Plus用户每天会有更多用量,具体来说:

- ChatGPT免费版:首次体验推理模型

- ChatGPT Plus和团队版:每天150次对话限制

- ChatGPT Pro:无限制访问

- ChatGPT Enterprise和ChatGPT Edu:将在一周内可用

- API:向3-5级开发者开放(初期暂不支持图像分析功能)

- 输入1.10美元/百万token、输出4.40美元/百万token

感谢DeepSeek,o3-mini的价格这次算是彻底给打下来了——比OpenAI o1-mini便宜63%,比满血版o1便宜93%。(但仍是GPT-4o mini的7倍左右)

订阅用户已经在第一时间「告别」了o1-mini,还没来得及说再见

OpenAI表示,o3-mini的发布是在追求高效能智能技术道路上的又一重要里程碑。

通过优化科学(Science)、技术(Technology)、工程(Engineering)和数学(Mathematics)领域的推理能力,同时保持较低的成本,让高质量AI技术变得更加平易近人。

值得一提的是,在ChatGPT中,o3-mini采用的是「中等推理强度」,在速度和准确性之间取得平衡。所有付费用户还可以在模型选择器中选择o3-mini-high——响应时间略长但智能水平更高的版本。

01集成搜索,两种版本可选

去年12月, 。相较于上一代o1模型,o3在ARC-AGI等多项基准测试中刷新SOTA。

与o1-mini一样,o3-mini是最具性价比的推理模型,可谓是突破性能边界的「小巨人」。

在STEM领域,尤其是科学、数学和编程等方面,o3-mini性能表现卓越超越o1,并继承了上一代低成本和低延迟的优点。

对于开发者来说,o3-mini简直就是一份「大礼包」,它首次在小型推理模型中支持:包括函数调用、结构化输出和开发者消息、流式传输功能。

开发者可以根据需求选择低、中、高三种推理强度,让o3-mini在处理复杂问题时进行「深度思考」,灵活平衡速度和准确性。

遗憾地是,o3-mini暂不支持视觉功能。

如前所述,从今天起,o3-mini将通过Chat Completions API,Assistants API和Batch API向3-5级指定开发者开放。

同时,o3-mini还整合了搜索功能,能够提供带有相关网络来源链接最新响应。

一起来看看这款「小而美」的o3-mini有什么过人之处。

02专为STEM领域推理优化

与其前身OpenAI o1类似,OpenAI o3-mini专门针对STEM推理进行了优化。

采用了中等推理强度的o3-mini,在数学、编程和科学领域的表现与o1不相上下,且响应速度更快。

报告地址:https://cdn.openai.com/o3-mini-system-card.pdf

专家测试评估显示,o3-mini相比o1-mini能够生成更准确、更清晰的答案,推理能力更强。

在测试中,o3-mini的响应结果获得了56%的偏好度,在处理复杂现实问题时的重大错误率更是降低了39%。

在中等推理强度设置下,o3-mini在最具挑战性的推理和智能评估项目(包括AIME和GPQA)中,均达到了与o1相当的水平。

数学竞赛(AIME 2024)

在低推理强度下,o3-mini达到了与o1-mini相当的水平;在中等推理强度下,其表现可与o1媲美;而在高推理强度下,o3-mini的表现更是超越了o1-mini和o1。

博士级科学问题(GPQA Diamond)

研究级数学(FrontierMath)

在高推理强度模式下,o3-mini在FrontierMath中的表现优于前代产品。当配合Python工具使用时,高推理强度的o3-mini能够一次性解决超过32%的测试题目,其中包括28%以上的T3级问题。

编程竞赛(Codeforces)

随着推理强度的提升,OpenAI o3-mini的Elo得分不断提高,各层级表现均优于o1-mini。在中等推理强度下,其表现已能与o1相媲美。

软件工程(SWE-bench Verified)

o3-mini在高推理强度模式下,使用开源Agentless框架能达到39%的成功率,使用内部工具框架则可达到61%的成功率。

LiveBench编码

人类偏好评估

外部专家评测结果显示,o3-mini较o1-mini表现出更强的推理能力,能够生成更准确、更清晰的答案,尤其是在STEM领域中。在对比测试中,o3-mini获得了56%的用户偏好度,且在处理复杂现实问题时的重大错误率降低了39%。

在技术报告中,o3-mini编程性能超越了GPT-4o和o1-preview,与o1不相上下。

03模型的速度与性能

o3-mini在保持与o1相当智能水平的同时,实现了更快的运行速度和更高的计算效率。

除前文提到的STEM评估外,在中等推理强度下,o3-mini在其他数学能力和事实准确性测试中均取得了显著优势。

对比测试(A/B Testing)结果显示,o3-mini的平均响应时间为7.7秒,较o1-mini的10.16秒提升了24%。

o1-mini和o3-mini(medium)的延迟对比

04安全评估

OpenAI在训练o3-mini确保其安全响应,采用的关键技术之一是审慎对齐(deliberative alignment)。

这项技术使模型能够在响应用户提示词前,对人工制定的安全规范进行全面推理。

与o1相似,o3-mini在高难度安全性测试和越狱评估中,明显优于GPT-4o。

在正式部署前,研究人员采用与o1相同的准备方法,结合外部红队测试和安全性评估,对o3-mini的安全风险进行了全面评估。

禁止内容评估

越狱评估

05OpenAI急了

去年年底放出o3和o3-mini的预览时,CEO奥特曼就曾表示,o3-mini将会在1月份发布。

随后,奥特曼又在1月17日预告称,o3-mini会在几周内发布。

现在,o3-mini果然如约而至(卡在ddl最后一天),但外面的世界已经是天差地别。

面对正在快速崛起的DeepSeek-R1,o3-mini存在着一个关键问题——「不开源」。

这也就意味着,它无法离线使用、无法下载代码,也无法以相同的程度进行自定义。对于很多应用过来说,它的吸引力相对于R1明显大打折扣。

在上下文窗口方面,DeepSeek-R1约为128K/130K token,而o3-mini略胜一筹达到了200K token。其中,每个输出最多100K token,跟满血版o1相同。

在价格方面,相比于输入/输出token分别为0.14/0.55美元的DeepSeek-R1,o3-mini依然贵出了天际。

但作为一款美国模型,o3-mini在身份上无疑占尽了好处:应该会是欧美很多企业的首选。

奥特曼亲自率队

这一次,最强最新的o3-mini模型训练,奥特曼本尊下场亲自率队。研究项目主管分别是Carpus Chang和Kristen Ying。

接下来,如果说OpenAI还藏在什么杀手锏,那就是满血版的o3了。根据12月时的说法,它将在「此后不久」发布。

参考资料:

https://openai.com/index/openai-o3-mini/

https://openai.com/index/o3-mini-system-card/

转载原创文章请添加微信:founderparker

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
海外谈中国:004型航母舰艏部分已经完成 几乎确定采用核动力系统

海外谈中国:004型航母舰艏部分已经完成 几乎确定采用核动力系统

hawk26讲武堂
2026-08-23 11:27:40
中国广电的至暗时刻——从“独家生意”到工资发不出来的警示录

中国广电的至暗时刻——从“独家生意”到工资发不出来的警示录

生活新鲜市
2026-08-18 01:34:19
致3车事故 !事发深南大道,市民报警!驾驶人冯某雷被拘

致3车事故 !事发深南大道,市民报警!驾驶人冯某雷被拘

南方都市报
2026-08-23 18:10:38
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
财政部:遗产税起征了?有房就达标,应纳税总额只能扣除几万元?

财政部:遗产税起征了?有房就达标,应纳税总额只能扣除几万元?

周军律师聊案子
2026-08-22 16:12:46
王宝强带女友参加婚礼,冯清苹果肌肿胀明显,被吐槽医美过度!

王宝强带女友参加婚礼,冯清苹果肌肿胀明显,被吐槽医美过度!

娱乐团长
2026-07-07 11:00:01
《道德经》:你面容出众就要性格强硬;你能力过人,最好姿态高冷;你有本事就得让人不好靠近!这不是叫你变坏,而是教你这两件事

《道德经》:你面容出众就要性格强硬;你能力过人,最好姿态高冷;你有本事就得让人不好靠近!这不是叫你变坏,而是教你这两件事

心理观察局
2026-08-22 07:42:09
中美局势可能发生大反转,最先超过美国的,不是经济,是这个方面

中美局势可能发生大反转,最先超过美国的,不是经济,是这个方面

谢葥邮轮摄影
2026-08-21 23:26:19
形势到底有多严峻?网传师范生要凉了,没有了前途…

形势到底有多严峻?网传师范生要凉了,没有了前途…

慧翔百科
2026-08-21 12:18:25
普京警告:乌克兰已“打开潘多拉魔盒”

普京警告:乌克兰已“打开潘多拉魔盒”

观察者网
2026-08-23 08:11:04
徐向前晚年吐露终极秘史:若无西安事变,红军早已开启第二次长征

徐向前晚年吐露终极秘史:若无西安事变,红军早已开启第二次长征

范剬舍长
2026-08-16 10:21:07
比《牛来》还狠!一人包办整部电影,《目不转睛》9.17上映!

比《牛来》还狠!一人包办整部电影,《目不转睛》9.17上映!

动物奇奇怪怪
2026-08-23 01:30:22
刘思齐改嫁后生下四个儿子,长子取名以永远纪念毛岸英,但毛岸英的抚恤金却拖了整整40年才发放

刘思齐改嫁后生下四个儿子,长子取名以永远纪念毛岸英,但毛岸英的抚恤金却拖了整整40年才发放

人生录
2026-08-20 00:05:09
刘畊宏健身直播遇冷,“老板娘”的身材打破了多少人的减肥梦?

刘畊宏健身直播遇冷,“老板娘”的身材打破了多少人的减肥梦?

解说阿洎
2026-08-23 09:08:38
纪实:浙江女教师突然失踪6年,13岁儿子凭借一个梦找到母亲

纪实:浙江女教师突然失踪6年,13岁儿子凭借一个梦找到母亲

红豆讲堂
2024-10-25 09:45:59
49岁赵薇广东饭局近照疯传!瘦脱相显凶相,当年的小燕子彻底凉透了

49岁赵薇广东饭局近照疯传!瘦脱相显凶相,当年的小燕子彻底凉透了

扒星人
2026-08-22 16:54:24
经济学家马光远:根据国际经验,房地产再回到上一轮高点需要10年

经济学家马光远:根据国际经验,房地产再回到上一轮高点需要10年

史之铭
2026-08-22 18:13:05
Waymo自研ASIC芯片算力破千TOPS 自动驾驶成本与功耗双降

Waymo自研ASIC芯片算力破千TOPS 自动驾驶成本与功耗双降

全栈遛狗员
2026-08-22 20:07:26
准备疯抢东契奇!密切关注湖人!

准备疯抢东契奇!密切关注湖人!

柚子说球
2026-08-23 19:26:26
10万亿窟窿!比恒大更坑的民企来了,曾力压许家印,位居第一

10万亿窟窿!比恒大更坑的民企来了,曾力压许家印,位居第一

孤单是寂寞的毒
2026-03-04 15:38:03
2026-08-23 21:24:49
FounderPark incentive-icons
FounderPark
关注AI创业,专注和创业者聊真问题
1296文章数 163关注度
往期回顾 全部

科技要闻

“英伟达发通知:涨价15%以上”

头条要闻

三姐弟太饿报警求助警察上门做饭 曾联系家人无法赶回

头条要闻

三姐弟太饿报警求助警察上门做饭 曾联系家人无法赶回

体育要闻

46岁小罗复出,为什么选了一支意丙球队?

娱乐要闻

王传君的舞台,藏着与乔任梁的过往

财经要闻

加拿大宣布“全额对等报复”美国新关税

汽车要闻

华为乾崑全栈赋能/更倾向城市出行 猛士X700车展首秀

态度原创

亲子
健康
时尚
游戏
艺术

亲子要闻

冰棍被大人一口吃完,小孩哥情绪崩溃还不忘扔垃圾

“矫正神器”真能治好脊柱侧弯吗?

夏天别总穿白色T恤,试试这几款衬衫,配裤子裙子都显气质

曝《GTA6》黑客想在泄露加广告 仅沟通费用上百万

艺术要闻

吴冠中 同一年毁了200幅画,这张拍了305万!

无障碍浏览 进入关怀版