网易首页

注册免费邮箱

网易首页 > 网易号 > 正文申请入驻

刚刚，新版DeepSeek-R1正式开源！直逼o3编程强到离谱，一手实测来了

2025-05-29 09:07:04　来源: 新智元

北京举报

0

分享至

新智元报道

编辑：编辑部 YXZH

【新智元导读】新版DeepSeek-R1重磅开源，凌晨已放出权重！此次模型性能几乎与o4-mini（Medium）相当，编程实测超越Claude 4 Sonnet。网友纷纷惊叹：开源又一次胜利了。

临近端午假期，DeepSeek果然又开始搞事。

就在今天凌晨，新版DeepSeek-R1正式开源了！

DeepSeek-R1-0528模型权重已上传到HuggingFace，不过模型卡暂未更新。

项目地址：https://huggingface.co/deepseek-ai/DeepSeek-R1-0528/tree/main

时隔4个月，DeepSeek-R1完成了超进化，编码能力强到离谱，而且思考时间更长了。

据称，新模型基于DeepSeek-V3-0324训练（参数为660B）。

经典物理模拟测试中，DeepSeek-R1新旧版本的对比

在LiveCodeBench基准上，DeepSeek-R1-0528性能几乎与o3-mini（High）和o4-mini（Medium)实力相当，一举超越了Gemini 2.5 Flash。

有网友称赞，DeepSeek-R1能够像o3一样纠正思维链，并且像Claude一样创造性进行世界构建。

可以说，这是属于开源模型的巨大胜利！

不用R2，直接对标SOTA

此次，DeepSeek-R1-0528更新核心亮点，网友做了一个浓缩版的总结：

能像谷歌模型一样深度推理
文本生成优化：更自然，格式更佳
独特的推理风格：不仅快，而且更缜密
支持长时思考：单任务处理时长可达30-60分钟

思考时间更长，成为了全网讨论最多的一点。有网友实测后，R1思考时长超过了25分钟。

另外，这似乎是唯一一个能持续正确做对「9.9 - 9.11是多少」的模型。

编程能力强到爆

网友实测显示，新版DeepSeek-R1在编程方面简直不可思议！

AI圈大佬「karminski-牙医」用同一个prompt测试了DeepSeek-R1-0528和Claude 4 Sonnet后发现。

不管是光线照射在墙上形成的漫反射，还是球在撞击后的运动方向，亦或是控制面板的美观程度，这一把R1稳赢。

网友Alex的测试也显示出，DeepSeek-R1在前端编码的能力上超越了Claude 4 Sonnet。

网友Haider.则是让模型构建一个单词评分系统。R1简要思考后，就立刻出了关于代码和工作测试的两个文件，第一次运行就完美无瑕。

此前，o3是唯一能完成这个任务的模型。而如今，R1堪称是完成这个任务的最佳模型。

注意，R1的表现之所以如此惊人，是因为它返回的两个文件在第一次都能运行良好，不用编辑，不用重试，这极其少见。

因为此前的大多数模型，要么会在边缘情况下终端，要么会做得太复杂，要么缺少适当的测试覆盖率。

和Gemini高能PK

还有人将DeepSeek-R1与Gemini 2.5 Pro进行了对标。同一个提示下，它们各自的表现如何？

首先是深度研究的能力，给出「研究微剂量服用裸盖菇素对长期认知的影响，需引用学术来源」提示。

这一把Gemini的响应更快，引用了可靠的研究文献，并且答案结构清晰。

再来看看它们搜索+对比能力如何？提示模型用实时来源列出全民基本收入（UBI）的五大优点和缺点。

这时，Gemini 2.5 Pro和DeepSeek R1表现都不错，打成平手。

Prompt: List top 5 pros/cons of Universal Basic Income using live sources.

再让模型为AI SaaS工具制定TikTok增长策略，两款模型再次打成平局。

在智能体任务规划方面，让Gemini和DeepSeek一同设计一个完整的市场调研智能体，包含工具链、用户角色和流程交接，结果是Gemini生成一张信息图，而DeepSeek稍逊一筹。

由此，大家对DeepSeek-R2的期待值也是拉满了。

一手实测来了

新版DeepSeek-R1的能力经过我们实测，虽然是一次「小版本」更新，但是性能得到了「史诗级」的加强。

尤其是编程能力，感觉已经超过或者足以媲美Claude 4和Gemini 2.5 Pro，可以说所有提示都是「一把过」，不需要任何修改！并且可以在网页端直接运行，展示效果。

首先是制作一个「新智元」字体在宇宙中旋转的3D动画，完成度相当之高。

对于简单任务，DeepSeek-R1的思考时间明显缩短，不再像以前对简单任务也疯狂思考。

设计一个新智元的官方网站，对于这种相对容易的任务，DeepSeek-R1-0528只需要10s的思考时间。

能够明显感觉到，这次DeepSeek-R1新版本的思考过程更加稳定。

以模拟一个太阳系运行为例，还要求行星比例大小与实际相同，能看到DeepSeek-R1-0528的思考过程已经趋近于「完美」。

最后，再给DeepSeek-R1-0528上点强度，要求演示篮球落地后的弹跳过程，并且要完美遵循现实中物理规律。

最终DeepSeek的成果还贴心的设计了参数控制面板，以及速度方向指示，是真的很强，以上所有代码都是提示之后一遍过，没有任何的Debug过程。

对于类似「华容道」的多步骤思考问题，DeepSeek-R1-0528的表现也非常完美，

比如「一位农夫要带一只狐狸、一只鹅和一袋豆子过河。船每次只能载他和一样物品。如果农夫不在场，狐狸会吃掉鹅，鹅会吃掉豆子。请问农夫该如何安排过河，才能确保所有物品安全？」这种复杂推理问题，DeepSeek-R1还可以给出核心问题所在。

最令我感到震惊的是，这次的「思考」能力似乎进行了秘密加强。

我给他了一个非常无厘头的族谱问题：「我的妈妈的爸爸的儿子的侄女的孙子的爷爷的舅舅的外孙女的姑姑，是我的谁，你能画出关系族谱图吗?」

以下过程经过3倍加速，可以看到DeepSeek-R1真的在通过数学的符号化方式在进行思考。

并且最后还真让他分析出了结果，简直震惊！这么长的思考链条都没有断。

另外值得一提的是，这次的思考过程并没有遇到服务算力不够的情况，看来DeepSeek有针对性的提高了算力，毕竟现在是模型刚发布后的高峰「测评」期。

参考资料：

https://chat.deepseek.com/

https://x.com/i/status/1927770337170592033

https://x.com/Yuchenj_UW/status/1927828675837513793

https://x.com/chetaslua/status/1927716608384094545

https://x.com/AiBattle_/status/1927824419478536405

https://huggingface.co/deepseek-ai/DeepSeek-R1-0528/tree/main

责任编辑：郜雪丹_NT5097

特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐

热点推荐

“秦始皇遣使采药昆仑石刻”最新进展：国家文物局认定为秦代石刻

封面新闻 2025-09-15 12:32:15
21224 跟贴 21224
网友在湘西发现“黄金虫”引200万人围观！这是什么虫？

鲁中晨报 2025-09-16 09:35:10
120 跟贴 120

济南百年天桥再迎大修房屋征收补偿方案公布

闪电新闻 2025-09-16 13:37:40
1 跟贴 1

徐卓一110米栏赢了今年世界第一

现代快报 2025-09-15 22:40:06
690 跟贴 690
河南一景点石头被彩绘，如同巨型蛇头，当地管委会：没有危险可以放心游玩

潇湘晨报 2025-09-12 11:19:12
1649 跟贴 1649

上海迎来第52个高温日，追平“史上第二”！今年秋老虎为啥这么猛？再等等，就要凉快了

新民晚报 2025-09-16 12:35:59
0 跟贴 0

道歉都透着一股子傲慢味，顾客到底怎么“虐”你了？

上游新闻 2025-09-15 16:07:02
2280 跟贴 2280
“小电驴”新国标落地两周：新旧车都在涨价，旧车“不愁卖”，新车还没铺货

红星资本局 2025-09-15 17:54:12
1735 跟贴 1735

当民办本科的学费越来越贵

澎湃新闻 2025-09-16 09:04:30
67 跟贴 67
火爆！广州11区民政局均已约满

鲁中晨报 2025-09-16 10:59:04
28 跟贴 28
专家：国家已划定预制菜范围，预处理的食品原料不等同于预制菜

第一财经资讯 2025-09-12 22:11:28
2802 跟贴 2802
成都大雨海昌路积水淹到市民小腿肚，目前已恢复畅通

封面新闻 2025-09-16 13:16:06
0 跟贴 0
一觉醒来，iPhone用户有点忙，“改变最大的一次更新”

都市快报橙柿互动 2025-09-16 09:02:45
0 跟贴 0
万斯主持《查理·柯克秀》当场哽咽:竟然有人在柯克坟墓上面跳舞

海外网 2025-09-16 08:40:24
115 跟贴 115
深圳市民捡到2267.83克巨型金条，已交还失主

新快报新闻 2025-09-15 19:28:09
200 跟贴 200
以“立破之道”建设好全国统一大市场

人民网 2025-09-16 06:38:14
51 跟贴 51
我国成功发射卫星互联网技术试验卫星

半岛官网 2025-09-16 15:03:26
2 跟贴 2
为批评正名

autocarweekly 2025-09-16 15:35:25
0 跟贴 0
杭州52岁女子空地接触废弃氢氟酸去世，附近居民：以前空地有围墙，被车撞坏后没人修

潇湘晨报 2025-09-16 15:35:04
0 跟贴 0
“化骨水”氢氟酸引热议生产厂家相关负责人：属于危化品，购买需提供相关资质

红星新闻 2025-09-16 14:57:28
0 跟贴 0
广东一餐厅被曝收8个月婴儿茶位费，最新回应来了

大象新闻 2025-09-16 09:07:07
0 跟贴 0
梅德韦杰夫：若北约击落俄无人机将意味着战争

财联社 2025-09-15 16:53:12
0 跟贴 0
苍南12家探店机构被约谈！

在苍南 2025-09-16 15:37:23
0 跟贴 0
妈妈亲手缝的“NIKE”书包火了，收到800多万点赞！

大象新闻 2025-09-16 08:43:12
0 跟贴 0
买菜时忘拔钥匙，电动车被盗！湖北枣阳警方不到两小时帮寻回

极目新闻 2025-09-16 15:40:28
0 跟贴 0
"最快护士"张水华放弃9月"沈马"：我被骂醒了

新京报 2025-09-16 15:39:51
0 跟贴 0
杭州女子踩“化骨水”离世后续！警方在附近再挖出两桶，疑点重重

有范又有料 2025-09-16 15:35:58
0 跟贴 0

于朦胧事件后，程青松被扒更多“新料”，不愧是“影视圈大佬”

于朦胧事件后，程青松被扒更多“新料”，不愧是“影视圈大佬”

阿会情感

2025-09-14 13:35:03

为人处世，碰都不要碰的10大禁忌。

为人处世，碰都不要碰的10大禁忌。

四象八卦

2025-09-14 10:19:15

俄大使：无人机进入罗马尼亚领空是乌方蓄意挑衅

俄大使：无人机进入罗马尼亚领空是乌方蓄意挑衅

参考消息

2025-09-15 20:34:08

毛主席开会烟没了，见李先念抽雪茄，问：这么好的烟，咋不告诉我

毛主席开会烟没了，见李先念抽雪茄，问：这么好的烟，咋不告诉我

慧说史家

2025-08-06 10:59:54

成都警方：25岁女子自缢身亡，生前系自由职业

成都警方：25岁女子自缢身亡，生前系自由职业

新京报

2025-09-16 09:28:54

实力撑不起野心！大衣哥前儿媳陈亚男创业失败，被前夫狠狠打脸

实力撑不起野心！大衣哥前儿媳陈亚男创业失败，被前夫狠狠打脸

小杨侃事

2025-09-15 11:11:16

秦奋的亿万财富来源揭秘

萧獻记录风土人情

2025-08-18 21:50:49

南京文旅太有才！直接攻击泰州最薄弱的地方：听说你现在算苏南了

南京文旅太有才！直接攻击泰州最薄弱的地方：听说你现在算苏南了

史行途

2025-09-16 13:06:20

中美马德里经贸会谈成果公布

环球时报国际

2025-09-16 10:44:45

德州理工闹剧！黑人女生查理·柯克追悼会上挑衅被捕，州长发声：“挑错了学校！”

德州理工闹剧！黑人女生查理·柯克追悼会上挑衅被捕，州长发声：“挑错了学校！”

华人生活网

2025-09-16 04:25:47

特雷·杨：在我生涯第八年，球队终于有了争夺总冠军的实力

特雷·杨：在我生涯第八年，球队终于有了争夺总冠军的实力

雷速体育

2025-09-16 08:43:08

昔日陕西餐饮龙头，被1.35亿拍卖

昔日陕西餐饮龙头，被1.35亿拍卖

每日经济新闻

2025-09-15 19:28:02

莫言：女人接近男人，不过图这两样东西，那她也不缺一个祖宗供着

莫言：女人接近男人，不过图这两样东西，那她也不缺一个祖宗供着

诗词中国

2025-09-04 17:56:45

41岁舞都跳不动还开演唱会捞金，本想回馈粉丝，全网却恶评如潮

41岁舞都跳不动还开演唱会捞金，本想回馈粉丝，全网却恶评如潮

春序娱乐

2025-09-16 13:58:32

43岁贾玲最新状态再创新巅峰，网友：这样一看，言承旭高攀了

43岁贾玲最新状态再创新巅峰，网友：这样一看，言承旭高攀了

娱乐故事

2025-09-14 23:56:02

梁晓声：最有钱的人，在儿女中学毕业后送出国，一是怕孩子吃苦..

梁晓声：最有钱的人，在儿女中学毕业后送出国，一是怕孩子吃苦..

清风拂心

2025-09-15 13:15:09

不明飞行物被击落后续：海事局发通报显端倪，身份快真相大白了！

不明飞行物被击落后续：海事局发通报显端倪，身份快真相大白了！

科普100克克

2025-09-15 02:28:33

中国女农场主在赞比亚遇难，死因曝光！韩红的话，终于有人信了

中国女农场主在赞比亚遇难，死因曝光！韩红的话，终于有人信了

来科点谱

2025-08-06 09:11:25

罗永浩公开担心自己可能失踪，继续闹下去可能性很大

罗永浩公开担心自己可能失踪，继续闹下去可能性很大

深度财线

2025-09-15 22:18:55

为什么中国社保会走到今天？看中国社保的矛盾与制度

为什么中国社保会走到今天？看中国社保的矛盾与制度

老丁是个生意人

2025-08-20 00:17:31

AI产业主平台领航智能+时代

13456文章数 66154关注度

往期回顾全部

科技要闻

理想i6定档9月26日发布，定位纯电五座SUV

头条要闻

女子踩到"化骨水"事发地非私人用地现场再次挖出2瓶

头条要闻

女子踩到"化骨水"事发地非私人用地现场再次挖出2瓶

体育要闻

乌姆蒂蒂，为世界杯冠军赔上职业生涯

娱乐要闻

宋祖英事业巅峰隐退?李谷一道破原因

财经要闻

华与华秒怂罗永浩称已接到对方道歉

汽车要闻

优质智能体验/1.5T增程别克至境L7正式亮相

态度原创

+arrTaiduYuanC[i].tag+' | '+arrTaiduYuanC[i].title+'
\

本地

游戏

手机

艺术

军事航空

本地新闻

云游忻州 | 慢时光！老街逛吃，烟火气超上头~

《蜘蛛侠2》废案DLC内容泄露 "甲虫"原为重要AI反派

手机要闻

OPPO Find X9系列发布在即：真2亿像素引领手机影像画质革命

艺术要闻

故宫珍藏的墨迹《十七帖》，比拓本更精良，这才是地道的魏晋写法

军事要闻

歼-20战机首次进行静态展示

© 1997-2025 网易公司版权所有 About NetEase | 公司简介 | 联系方法 | 招聘信息 | 客户服务 | 隐私政策 | 不良信息举报 Complaint Center | 廉正举报 | 侵权投诉

无障碍浏览进入关怀版