网易首页 > 网易号 > 正文 申请入驻

不只是“小升级”!DeepSeek-R1新版获海外盛赞,每经记者亲测挑战三大编程任务

0
分享至

5月29日凌晨,DeepSeek-R1-0528正式在Hugging Face平台开源。此前一日(5月28日),DeepSeek官方宣布DeepSeek-R1模型已完成小版本试升级,用户可通过官方网页、App、小程序进行测试(打开深度思考),API接口和使用方式保持不变。

在此次更新中,模型代码能力的提升最为显著。知名代码测试平台LiveCodeBench显示,更新后的R1性能可以媲美OpenAI o3模型的高版本。

除代码能力外,R1新版本模型的文本理解与推理能力亦实现跨越式升级。其上下文长度拓展至128k,长文本提取的准确率也有显著提升。

《每日经济新闻》记者(以下简称“每经记者”)通过俄罗斯方块游戏开发、太阳系模拟与交互展示,以及设计英伟达最新财报网页这三项任务对R1新版本进行了实测,发现DeepSeek-R1-0528的编程能力确实强大,对物理世界的理解以及文本的提取都相当准确。

知名AI评论人Haider在社交媒体上评价称,这是开源的一大胜利。

瑞士IT咨询公司CTOL Digital Solutions首席执行官Max Zhang则表示,在这一“小”进步之后,我们确实可以期待更大突破(DeepSeek-R2)的到来。

图片来源:Hugging Face

“小升级”实现“大跨越”:升级后的R1性能媲美o3模型高版本

DeepSeek延续了其一贯的低调风格,此次升级率先在微信群进行官宣,并轻描淡写地将其定义为“小版本升级”。

然而,众多开发者实测后发现,此次的“小”升级,并不小。升级后的DeepSeek-R1,模型能力可以说实现了跨越式提升。

图片来源:DeepSeek官方微信群截图

编码能力方面,代码测试平台LiveCodeBench显示,更新后的DeepSeek-R1性能接近OpenAI在4月中旬发布的o4-mini和o3模型高版本。

据测试者反馈,DeepSeek-R1-0528能够一次性生成超千行无Bug代码,且在HTML/CSS/JS动态交互实现(如天气卡片动画、数据可视化)中更加精准。

图片来源:代码测试平台LiveCodeBench

除代码能力外,新版本模型的文本理解与推理能力亦实现跨越式升级。其上下文长度拓展至128k,长文本提取的准确率也有显著提升

在Extended NYT Connections基准测试中,相比于前一代DeepSeek-R1,最新的0528版本的提升非常明显,得分从38.6%大幅升至49.8%。

图片来源:X

目前,ChatBot Arena也已经“上架”了最新版本的DeepSeek-R1,但还没有任何的测试结果。

图片来源:X

记者实测编程能力

为了更全面地测试DeepSeek-R1-0528的编程能力,每经记者设计了三项不同难度和类型的编程任务,包括网页游戏制作、物理世界模拟、财报可视化,来检验其在实际场景中的表现。

任务一:俄罗斯方块游戏开发

作为一款经典的休闲游戏,俄罗斯方块游戏的开发涉及图形绘制、游戏逻辑处理、用户交互等多个方面,能够很好地考察模型对于综合编程知识的掌握和运用能力。

每经记者首先向DeepSeek-R1提出需求:“请帮我开发一个网页端俄罗斯方块小游戏,要求包含游戏分数、彩色方块及多个关卡。”

DeepSeek仅思考了7秒,就开始输出代码。然而,初步生成的游戏无法正常运作,虽有预设的分数与关卡显示,但游戏区域内并没有俄罗斯方块。

图片来源:由DeepSeek生成

随后,记者调整提示词,仅提了最基础的要求,“请帮我写个俄罗斯方块游戏(网页端),直接可以上手玩。”

简洁的指令似乎对DeepSeek-R1-0528更加奏效。这次R1思考9秒,用时约3分30秒便生成了代码。

图片来源:由DeepSeek生成

从游戏页面来看,色彩搭配鲜明且协调,不同颜色的方块在深色背景下十分醒目,游戏区域布局合理,操作说明也清晰明了。

在游戏逻辑方面,方块的下落、移动和旋转都很流畅,没有出现延迟或卡顿现象。

可以说,已经具备了一个成熟俄罗斯方块游戏应有的功能和体验。

任务二:太阳系模拟与交互展示

接下来,难度升级。对于大模型而言,对物理世界进行准确模拟长期以来都是一项极具挑战性的任务。

此次,记者特意选取“行星轨道运动的物理模拟”这一任务,在考察其编码能力的同时,也考察DeepSeek-R1-0528对物理世界的理解能力。

记者向R1提出要求——写一个太阳系模拟网页,并且网页可交互展示。

因为任务更复杂,R1思考时间也相应变长,耗时54秒后开始输出代码。

图片来源:由DeepSeek生成

可以看出,R1的整体完成度极高,完全可以作为中小学科普动画的原型演示。

从界面呈现看,太阳居于中心,八大行星依照各自轨道有序排布,色彩搭配也符合人们对天体的认知。此外,行星的大小比例、相对位置都比较精准。

在交互功能方面,右侧控制面板设计简洁且功能丰富。

同时,页面“行星信息”板块还以简洁明了的文字介绍了太阳及各大行星的关键特征,如太阳的质量、直径,水星的公转周期、表面温度等,兼具科普性与趣味性。

任务三:设计英伟达最新财报网页

最后,每经记者上传了英伟达2026财年第一财季财报的文档,要求R1根据财报中的内容,制作一个可交互的网页。

财报中数据繁杂,文本较长,非常考察模型准确提取文本的能力。

图片来源:由DeepSeek生成

DeepSeek-R1生成的网页令人眼前一亮。在视觉呈现上,网页采用了标志性的“英伟达绿”,颜色搭配协调。

数据方面,基本做到了准确无误,很少出现“幻觉”情况。此外,模型还绘制了柱状图、饼图等图表,让复杂的数据变得一目了然。

尽管可能还存在一些细微的提升空间。比如,在涨跌幅的颜色上,我们通常用红色表示上涨,绿色表示下跌。但可能由于记者投喂的是美股公司财报(美股一般用绿色表示上涨,红色表示下跌),R1用了与之对应的颜色来展示涨跌幅。

整体来看,R1已充分彰显其在复杂任务处理上的卓越潜力。

“全球AI竞赛关键节点”!DeepSeek-R1新版获海外盛赞

DeepSeek最新发布的R1模型升级版在全球AI领域掀起热议,多位国际主流科技大佬及行业高管纷纷发声,盛赞其技术突破。

机器学习研究者kalomaze实测后赞叹道,“DeepSeek太出色了。”

Hyperbolic Labs联合创始人兼首席技术官Yuchen Jin表示,新版R1似乎是唯一能回答9.9减9.11等于几的模型。

知名AI评论人Haider直呼,这是开源的一大胜利。“DeepSeek王者归来了。新版本的DeepSeek-R1在编程方面简直令人难以置信,这是我测试过的最佳模型。”

AI撰稿人乔治·霍普金(George Hopkin)表示,DeepSeek的R1模型更新后,推理和输出能力大幅提升,标志着中国在全球AI竞赛中的影响力日益增强

瑞士IT咨询公司CTOL Digital Solutions首席执行官Max Zhang指出,DeepSeek的最新版R1模型,正悄然成为谷歌Gemini 2.5 Pro的强劲竞争对手。“这一发展不仅仅是技术进步,更是全球AI竞赛中的一个关键节点。该模型凭借其双倍输出能力和增强的数学推理能力,展示了中国在AI领域的快速崛起。”

DeepSeek此次更新的亮眼表现,为DeepSeek的下一代模型R2注入更多想象空间。Max Zhang表示,在这一“小”进步之后,我们确实可以期待更大突破的到来。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
突发!上海最大商场砸的62亿悬了!

突发!上海最大商场砸的62亿悬了!

新浪财经
2026-03-26 00:14:57
郜林:来铭途一个月没开过会;当总经理和踢球不同

郜林:来铭途一个月没开过会;当总经理和踢球不同

懂球帝
2026-03-26 22:00:56
中国最有名的9条家训,读懂一条旺家三代,建议收藏反复背诵

中国最有名的9条家训,读懂一条旺家三代,建议收藏反复背诵

长风文史
2026-03-25 17:58:23
中美卫星导航用户数量悬殊:GPS用户数超60亿,中国北斗令人意外

中美卫星导航用户数量悬殊:GPS用户数超60亿,中国北斗令人意外

混沌录
2026-03-18 23:54:31
伊朗新最高领袖莫贾塔巴哈梅内伊已同意与美国进行谈判并达成协议

伊朗新最高领袖莫贾塔巴哈梅内伊已同意与美国进行谈判并达成协议

深度报
2026-03-25 22:47:08
华为、商汤等873家机构遭AI顶会“封杀”,中国学界怒了

华为、商汤等873家机构遭AI顶会“封杀”,中国学界怒了

智东西
2026-03-26 20:49:23
巴基斯坦把稀土卖给美国,以为捏住中国“七寸”,其实在玩火自焚

巴基斯坦把稀土卖给美国,以为捏住中国“七寸”,其实在玩火自焚

通文知史
2026-03-24 08:35:03
宋美龄书法对比:钢笔字似小学生,英文手稿如中学生!

宋美龄书法对比:钢笔字似小学生,英文手稿如中学生!

书画相约
2026-03-26 07:49:18
先被里瓦尔多全面逆袭,后遭齐达内强势碾压,全能战士时运不济

先被里瓦尔多全面逆袭,后遭齐达内强势碾压,全能战士时运不济

足篮大世界
2026-03-26 10:52:09
三次精准躲过斩首行动,卡尼突然现身反转剧情,伊朗这局水太深了

三次精准躲过斩首行动,卡尼突然现身反转剧情,伊朗这局水太深了

盛夏微凉
2026-03-24 18:10:08
卡尔森:坏了!原来小丑不是特朗普,而是我自己

卡尔森:坏了!原来小丑不是特朗普,而是我自己

朝廷心腹
2026-03-26 09:07:14
真的太孤独了!山东47岁母亲称已怀胎8月,两女远嫁却极力反对…

真的太孤独了!山东47岁母亲称已怀胎8月,两女远嫁却极力反对…

火山詩话
2026-03-25 13:41:56
张近东资产清零,张朝阳手握百亿现金:两种人生,一个忠告

张近东资产清零,张朝阳手握百亿现金:两种人生,一个忠告

老特有话说
2026-03-26 14:31:44
一天蒸发6200亿!谷歌算法黑科技击溃存储股,华尔街痛批市场“不懂技术”

一天蒸发6200亿!谷歌算法黑科技击溃存储股,华尔街痛批市场“不懂技术”

每日经济新闻
2026-03-26 19:00:13
中国摩托在越南被日本本田打的惨败!现在又一路翻盘,太解气!

中国摩托在越南被日本本田打的惨败!现在又一路翻盘,太解气!

万物知识圈
2026-03-26 15:19:33
苹果受追捧,国产手机涨价基本失败了,正在悄悄降价

苹果受追捧,国产手机涨价基本失败了,正在悄悄降价

柏铭锐谈
2026-03-24 15:38:55
马英九亲自下场后,蓝营大佬集体回应,台媒体人:罪在马英九

马英九亲自下场后,蓝营大佬集体回应,台媒体人:罪在马英九

DS北风
2026-03-25 18:50:17
iPhone半夜自动打电话,苹果官网发文回应

iPhone半夜自动打电话,苹果官网发文回应

界面新闻
2026-03-26 15:46:22
公积金新调整!4月1日起,职工可自愿提高缴存比例

公积金新调整!4月1日起,职工可自愿提高缴存比例

另子维爱读史
2026-03-25 22:28:47
颖儿太敢了!素颜曝光脸颊凹陷,做医美全程不藏着,疼到五官扭曲

颖儿太敢了!素颜曝光脸颊凹陷,做医美全程不藏着,疼到五官扭曲

圆梦的小老头
2026-03-26 21:31:03
2026-03-27 00:00:49
每日经济新闻 incentive-icons
每日经济新闻
中国主流财经全媒体平台。
1519463文章数 2724758关注度
往期回顾 全部

科技要闻

美团发布外卖大战后成绩单:亏损超200亿

头条要闻

张雪峰留巨额遗产:二婚妻子或拿50% 剩下的女儿占1/3

头条要闻

张雪峰留巨额遗产:二婚妻子或拿50% 剩下的女儿占1/3

体育要闻

申京努力了,然而杜兰特啊

娱乐要闻

刘晓庆妹妹发声!称姐姐受身边人挑拨

财经要闻

油价"驯服"特朗普?一到100美元就TACO

汽车要闻

一汽奥迪A6L e-tron开启预售 CLTC最大续航815km

态度原创

亲子
游戏
本地
时尚
公开课

亲子要闻

看看把孩子吓得哈哈哈

"死亡搁浅"外骨骼来了!小岛工作室转发联名 原度拉满

本地新闻

救命,这只酱板鸭已经在我手机复仇了一万遍

400万人爱过的女孩,被黄谣网暴180天后

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版