网易首页 > 网易号 > 正文 申请入驻

刚刚,新版DeepSeek-R1正式开源!直逼o3编程强到离谱,一手实测来了

0
分享至


新智元报道

编辑:编辑部 YXZH

【新智元导读】新版DeepSeek-R1重磅开源,凌晨已放出权重!此次模型性能几乎与o4-mini(Medium)相当,编程实测超越Claude 4 Sonnet。网友纷纷惊叹:开源又一次胜利了。

临近端午假期,DeepSeek果然又开始搞事。

就在今天凌晨,新版DeepSeek-R1正式开源了!

DeepSeek-R1-0528模型权重已上传到HuggingFace,不过模型卡暂未更新。


项目地址:https://huggingface.co/deepseek-ai/DeepSeek-R1-0528/tree/main

时隔4个月,DeepSeek-R1完成了超进化,编码能力强到离谱,而且思考时间更长了。

据称,新模型基于DeepSeek-V3-0324训练(参数为660B)。


经典物理模拟测试中,DeepSeek-R1新旧版本的对比

在LiveCodeBench基准上,DeepSeek-R1-0528性能几乎与o3-mini(High)和o4-mini(Medium)实力相当,一举超越了Gemini 2.5 Flash。


有网友称赞,DeepSeek-R1能够像o3一样纠正思维链,并且像Claude一样创造性进行世界构建。


可以说,这是属于开源模型的巨大胜利!

不用R2,直接对标SOTA

此次,DeepSeek-R1-0528更新核心亮点,网友做了一个浓缩版的总结:

  • 能像谷歌模型一样深度推理

  • 文本生成优化:更自然,格式更佳

  • 独特的推理风格:不仅快,而且更缜密

  • 支持长时思考:单任务处理时长可达30-60分钟


思考时间更长,成为了全网讨论最多的一点。有网友实测后,R1思考时长超过了25分钟。


另外,这似乎是唯一一个能持续正确做对「9.9 - 9.11是多少」的模型。


编程能力强到爆

网友实测显示,新版DeepSeek-R1在编程方面简直不可思议!

AI圈大佬「karminski-牙医」用同一个prompt测试了DeepSeek-R1-0528和Claude 4 Sonnet后发现。

不管是光线照射在墙上形成的漫反射,还是球在撞击后的运动方向,亦或是控制面板的美观程度,这一把R1稳赢。



网友Alex的测试也显示出,DeepSeek-R1在前端编码的能力上超越了Claude 4 Sonnet。




网友Haider.则是让模型构建一个单词评分系统。R1简要思考后,就立刻出了关于代码和工作测试的两个文件,第一次运行就完美无瑕。


此前,o3是唯一能完成这个任务的模型。而如今,R1堪称是完成这个任务的最佳模型。

注意,R1的表现之所以如此惊人,是因为它返回的两个文件在第一次都能运行良好,不用编辑,不用重试,这极其少见。

因为此前的大多数模型,要么会在边缘情况下终端,要么会做得太复杂,要么缺少适当的测试覆盖率。


和Gemini高能PK

还有人将DeepSeek-R1与Gemini 2.5 Pro进行了对标。同一个提示下,它们各自的表现如何?


首先是深度研究的能力,给出「研究微剂量服用裸盖菇素对长期认知的影响,需引用学术来源」提示。

这一把Gemini的响应更快,引用了可靠的研究文献,并且答案结构清晰。

再来看看它们搜索+对比能力如何?提示模型用实时来源列出全民基本收入(UBI)的五大优点和缺点。

这时,Gemini 2.5 Pro和DeepSeek R1表现都不错,打成平手。



Prompt: List top 5 pros/cons of Universal Basic Income using live sources.

再让模型为AI SaaS工具制定TikTok增长策略,两款模型再次打成平局。

在智能体任务规划方面,让Gemini和DeepSeek一同设计一个完整的市场调研智能体,包含工具链、用户角色和流程交接,结果是Gemini生成一张信息图,而DeepSeek稍逊一筹。

由此,大家对DeepSeek-R2的期待值也是拉满了。

一手实测来了

新版DeepSeek-R1的能力经过我们实测,虽然是一次「小版本」更新,但是性能得到了「史诗级」的加强。

尤其是编程能力,感觉已经超过或者足以媲美Claude 4和Gemini 2.5 Pro,可以说所有提示都是「一把过」,不需要任何修改!并且可以在网页端直接运行,展示效果。

首先是制作一个「新智元」字体在宇宙中旋转的3D动画,完成度相当之高。


对于简单任务,DeepSeek-R1的思考时间明显缩短,不再像以前对简单任务也疯狂思考。

设计一个新智元的官方网站,对于这种相对容易的任务,DeepSeek-R1-0528只需要10s的思考时间。


能够明显感觉到,这次DeepSeek-R1新版本的思考过程更加稳定。

以模拟一个太阳系运行为例,还要求行星比例大小与实际相同,能看到DeepSeek-R1-0528的思考过程已经趋近于「完美」。


最后,再给DeepSeek-R1-0528上点强度,要求演示篮球落地后的弹跳过程,并且要完美遵循现实中物理规律。


最终DeepSeek的成果还贴心的设计了参数控制面板,以及速度方向指示,是真的很强,以上所有代码都是提示之后一遍过,没有任何的Debug过程。

对于类似「华容道」的多步骤思考问题,DeepSeek-R1-0528的表现也非常完美,

比如「一位农夫要带一只狐狸、一只鹅和一袋豆子过河。船每次只能载他和一样物品。如果农夫不在场,狐狸会吃掉鹅,鹅会吃掉豆子。请问农夫该如何安排过河,才能确保所有物品安全?」这种复杂推理问题,DeepSeek-R1还可以给出核心问题所在。


最令我感到震惊的是,这次的「思考」能力似乎进行了秘密加强。

我给他了一个非常无厘头的族谱问题:「我的妈妈的爸爸的儿子的侄女的孙子的爷爷的舅舅的外孙女的姑姑,是我的谁,你能画出关系族谱图吗?」

以下过程经过3倍加速,可以看到DeepSeek-R1真的在通过数学的符号化方式在进行思考。


并且最后还真让他分析出了结果,简直震惊!这么长的思考链条都没有断。


另外值得一提的是,这次的思考过程并没有遇到服务算力不够的情况,看来DeepSeek有针对性的提高了算力,毕竟现在是模型刚发布后的高峰「测评」期。

参考资料:

https://chat.deepseek.com/

https://x.com/i/status/1927770337170592033

https://x.com/Yuchenj_UW/status/1927828675837513793

https://x.com/chetaslua/status/1927716608384094545

https://x.com/AiBattle_/status/1927824419478536405

https://huggingface.co/deepseek-ai/DeepSeek-R1-0528/tree/main

责任编辑:郜雪丹_NT5097

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
于朦胧事件后,程青松被扒更多“新料”,不愧是“影视圈大佬”

于朦胧事件后,程青松被扒更多“新料”,不愧是“影视圈大佬”

阿会情感
2025-09-14 13:35:03
为人处世,碰都不要碰的10大禁忌。

为人处世,碰都不要碰的10大禁忌。

四象八卦
2025-09-14 10:19:15
俄大使:无人机进入罗马尼亚领空是乌方蓄意挑衅

俄大使:无人机进入罗马尼亚领空是乌方蓄意挑衅

参考消息
2025-09-15 20:34:08
毛主席开会烟没了,见李先念抽雪茄,问:这么好的烟,咋不告诉我

毛主席开会烟没了,见李先念抽雪茄,问:这么好的烟,咋不告诉我

慧说史家
2025-08-06 10:59:54
成都警方:25岁女子自缢身亡,生前系自由职业

成都警方:25岁女子自缢身亡,生前系自由职业

新京报
2025-09-16 09:28:54
实力撑不起野心!大衣哥前儿媳陈亚男创业失败,被前夫狠狠打脸

实力撑不起野心!大衣哥前儿媳陈亚男创业失败,被前夫狠狠打脸

小杨侃事
2025-09-15 11:11:16
秦奋的亿万财富来源揭秘

秦奋的亿万财富来源揭秘

萧獻记录风土人情
2025-08-18 21:50:49
南京文旅太有才!直接攻击泰州最薄弱的地方:听说你现在算苏南了

南京文旅太有才!直接攻击泰州最薄弱的地方:听说你现在算苏南了

史行途
2025-09-16 13:06:20
中美马德里经贸会谈成果公布

中美马德里经贸会谈成果公布

环球时报国际
2025-09-16 10:44:45
德州理工闹剧!黑人女生查理·柯克追悼会上挑衅被捕,州长发声:“挑错了学校!”

德州理工闹剧!黑人女生查理·柯克追悼会上挑衅被捕,州长发声:“挑错了学校!”

华人生活网
2025-09-16 04:25:47
特雷·杨:在我生涯第八年,球队终于有了争夺总冠军的实力

特雷·杨:在我生涯第八年,球队终于有了争夺总冠军的实力

雷速体育
2025-09-16 08:43:08
昔日陕西餐饮龙头,被1.35亿拍卖

昔日陕西餐饮龙头,被1.35亿拍卖

每日经济新闻
2025-09-15 19:28:02
莫言:女人接近男人,不过图这两样东西,那她也不缺一个祖宗供着

莫言:女人接近男人,不过图这两样东西,那她也不缺一个祖宗供着

诗词中国
2025-09-04 17:56:45
41岁舞都跳不动还开演唱会捞金,本想回馈粉丝,全网却恶评如潮

41岁舞都跳不动还开演唱会捞金,本想回馈粉丝,全网却恶评如潮

春序娱乐
2025-09-16 13:58:32
43岁贾玲最新状态再创新巅峰,网友:这样一看,言承旭高攀了

43岁贾玲最新状态再创新巅峰,网友:这样一看,言承旭高攀了

娱乐故事
2025-09-14 23:56:02
梁晓声:最有钱的人,在儿女中学毕业后送出国,一是怕孩子吃苦..

梁晓声:最有钱的人,在儿女中学毕业后送出国,一是怕孩子吃苦..

清风拂心
2025-09-15 13:15:09
不明飞行物被击落后续:海事局发通报显端倪,身份快真相大白了!

不明飞行物被击落后续:海事局发通报显端倪,身份快真相大白了!

科普100克克
2025-09-15 02:28:33
中国女农场主在赞比亚遇难,死因曝光!韩红的话,终于有人信了

中国女农场主在赞比亚遇难,死因曝光!韩红的话,终于有人信了

来科点谱
2025-08-06 09:11:25
罗永浩公开担心自己可能失踪,继续闹下去可能性很大

罗永浩公开担心自己可能失踪,继续闹下去可能性很大

深度财线
2025-09-15 22:18:55
为什么中国社保会走到今天?看中国社保的矛盾与制度

为什么中国社保会走到今天?看中国社保的矛盾与制度

老丁是个生意人
2025-08-20 00:17:31
2025-09-16 16:04:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
13456文章数 66154关注度
往期回顾 全部

科技要闻

理想i6定档9月26日发布,定位纯电五座SUV

头条要闻

女子踩到"化骨水"事发地非私人用地 现场再次挖出2瓶

头条要闻

女子踩到"化骨水"事发地非私人用地 现场再次挖出2瓶

体育要闻

乌姆蒂蒂,为世界杯冠军赔上职业生涯

娱乐要闻

宋祖英事业巅峰隐退?李谷一道破原因

财经要闻

华与华秒怂 罗永浩称已接到对方道歉

汽车要闻

优质智能体验/1.5T增程 别克至境L7正式亮相

态度原创

本地
游戏
手机
艺术
军事航空

本地新闻

云游忻州 | 慢时光!老街逛吃,烟火气超上头~

《蜘蛛侠2》废案DLC内容泄露 "甲虫"原为重要AI反派

手机要闻

OPPO Find X9系列发布在即:真2亿像素引领手机影像画质革命

艺术要闻

故宫珍藏的墨迹《十七帖》,比拓本更精良,这才是地道的魏晋写法

军事要闻

歼-20战机首次进行静态展示

无障碍浏览 进入关怀版