网易首页 > 网易号 > 正文 申请入驻

不换模型,不扩参数,deepseek只换训练方法,干活能力暴涨6倍

0
分享至

先说大白话:这个模型到底变了什么?



用最简单的方式讲。

一个AI大模型从"出生"到"会干活",大致要经历两步:

第一步,预训练。

就是让模型疯狂"读书",把互联网上的文章、代码、教科书都读一遍,学会认字、理解句子、掌握基本知识。这时候的模型就像一个读了很多书的大学生,知识面很广,但不会干活。

第二步,后训练。

这就不是"读书"了,而是"练手艺"。比如你想让模型学会修Bug,你就拿成千上万个真实的Bug案例喂给它,让它一次次尝试修复,做对了给奖励,做错了继续练。练多了,它就知道"修Bug应该这样干"。

DeepSeek这次V4-Flash正式版,第一步完全没变,模型还是那个模型,读的书还是那些书。他们只重做了第二步:换了一套更好的"练手艺"方案。

结果呢?同样的脑子,换了训练方法之后,干活能力涨了6倍。

这就像一个班里两个学生,智商差不多,读的课本也一样,但一个老师只让他们背书,另一个老师天天带他们做实战项目。到期末考试时,后者直接把前者摁在地上摩擦。

二、数字不会骗人:到底厉害在哪?

DeepSeek官方公布了9项测试成绩,我们挑三个最直观的来看:

① 修Bug能力:从"基本不会"到"超过一半能搞定"

有一个叫DeepSWE的测试,专门考AI能不能独立修复真实开源项目里的Bug。以前V4-Flash预览版只能修好约7%的Bug——基本等于不会。现在正式版修好了54%,超过一半的Bug能自己搞定。

什么意思?以前你让AI帮你修代码Bug,10次里9次要你自己动手。现在差不多有一半的情况,它能自己修好,还修得对。

② 命令行操作能力:逼近满分

有个叫Terminal Bench的测试,考核AI能不能像程序员一样在电脑终端里一步步敲命令、装软件、排查问题。正式版拿了82.7分(满分100)。对比一下:Claude最贵的那个版本85分,DeepSeek只差2.3分——但价格是Claude的九十分之一。

③ 全栈开发能力:几乎翻倍

还有一个DSBench-FullStack测试,考AI能不能从零写一个完整的网站——包括前端页面、后端逻辑、数据库。预览版37分,正式版68.7分,翻了近一倍。

打个比方:以前这个模型像一个只会写HTML页面的初级前端,现在它能独立搭出一个带数据库、带登录功能的小网站了。

三、"后训练"到底是怎么做的?拿学开车举个例子

很多人还是觉得"后训练"很抽象。我们换个场景理解——

假设你要训练一个人学会开车:

预训练阶段:给他看一万本驾驶手册、交通法规、汽车构造原理。这时候他理论上知道"红灯停绿灯行""方向盘往左打车子往左转"。但真让他坐进驾驶座,他连刹车和油门都分不清。

后训练阶段:让他实际坐进驾驶座,找个教练陪练。先练倒车入库,练100次,每次停歪了就告诉他"往左回半圈";再练侧方停车,练200次;再练高速变道,练300次……练到肌肉记忆形成,不用想就知道脚该放哪。

DeepSeek的做法就是:不去换一个更聪明的"学员",而是换了一个更好的"教练",设计了一套更科学的练车方案。

这套方案好在哪?它不是让模型做选择题("以下哪项是正确的变道方式?"),而是让模型真的去执行任务("去,把这辆车的Bug修了"),做错了就分析错在哪、重新来。这种"干活→犯错→纠正→再干活"的循环,比死记硬背管用得多。

这就是为什么模型脑子没换,干活能力却涨了6倍——不是它变聪明了,是它终于知道"遇到这种问题该怎么动手"了。

四、那对我有什么用?

说一个最实在的:便宜。

这个模型调用100万个Token(大概相当于让它读完三本《三体》的字数):

  • 普通调用:花1块钱
  • 如果很多内容之前读过、缓存命中了:花2分钱

有开发者实测,用它跑一小时的代码任务,花了不到一块钱。

同时它的价格只有同级别国外模型的几十分之一。

这意味着什么?以前你让AI帮你做一个自动化工作流,比如每天自动抓取新闻、自动整理成表格、自动发邮件,你可能担心成本太高。现在成本低到可以忽略不计,每小时几毛钱。

对于做内容的人、写代码的人、开小店的人,这个模型就像雇了一个24小时不睡觉、工资几乎为零的"数字实习生"。虽然它不是天才,但大部分基础活它能干,而且干得越来越靠谱。

五、这意味着什么?大模型比赛换赛道了

过去两年,所有AI公司都在比一件事:谁家模型更大、参数更多。

你1000亿参数,我就2000亿,他3000亿,像军备竞赛一样。

DeepSeek这次用行动说了一句话:别比谁家脑子大了,比谁家训练得更会干活。

这对小公司是个大好消息。你不需要砸几十亿训练一个超大模型,只要后训练做得好,一个中等规模的模型也能在特定任务上干得很漂亮。

DeepSeek还透露了两个信息:V4-Pro正式版预计8月初上线(性能更强的版本);即将实施峰谷定价(早上9-12点、下午2-6点贵一倍,其他时间便宜)。

峰谷定价这个设计很聪明。就像电费一样,鼓励你把不着急的活安排在晚上跑,成本更低。这对做批量处理任务的人特别友好。

六、一句话总结

大模型能力的上限,不取决于脑子有多大,取决于训练方法有多好。

以前大家觉得"后训练"只是锦上添花。

现在才发现,它才是真正决定一个模型"能不能干活"的关键。

对于普通用户来说,最直接的影响就是:你手上的AI工具会越来越"会用"、越来越便宜。一个能干活、又几乎免费的AI助手,正在变成现实。

用最简单的方式讲。

一个AI大模型从"出生"到"会干活",大致要经历两步:

第一步,预训练。

就是让模型疯狂"读书",把互联网上的文章、代码、教科书都读一遍,学会认字、理解句子、掌握基本知识。这时候的模型就像一个读了很多书的大学生,知识面很广,但不会干活。

第二步,后训练。

这就不是"读书"了,而是"练手艺"。比如你想让模型学会修Bug,你就拿成千上万个真实的Bug案例喂给它,让它一次次尝试修复,做对了给奖励,做错了继续练。练多了,它就知道"修Bug应该这样干"。

DeepSeek这次V4-Flash正式版,第一步完全没变,模型还是那个模型,读的书还是那些书。他们只重做了第二步:换了一套更好的"练手艺"方案。

结果呢?同样的脑子,换了训练方法之后,干活能力涨了6倍。

这就像一个班里两个学生,智商差不多,读的课本也一样,但一个老师只让他们背书,另一个老师天天带他们做实战项目。到期末考试时,后者直接把前者摁在地上摩擦。

二、数字不会骗人:到底厉害在哪?

DeepSeek官方公布了9项测试成绩,我们挑三个最直观的来看:

① 修Bug能力:从"基本不会"到"超过一半能搞定"

有一个叫DeepSWE的测试,专门考AI能不能独立修复真实开源项目里的Bug。以前V4-Flash预览版只能修好约7%的Bug——基本等于不会。现在正式版修好了54%,超过一半的Bug能自己搞定。

什么意思?以前你让AI帮你修代码Bug,10次里9次要你自己动手。现在差不多有一半的情况,它能自己修好,还修得对。

② 命令行操作能力:逼近满分

有个叫Terminal Bench的测试,考核AI能不能像程序员一样在电脑终端里一步步敲命令、装软件、排查问题。正式版拿了82.7分(满分100)。对比一下:Claude最贵的那个版本85分,DeepSeek只差2.3分——但价格是Claude的九十分之一。

③ 全栈开发能力:几乎翻倍

还有一个DSBench-FullStack测试,考AI能不能从零写一个完整的网站——包括前端页面、后端逻辑、数据库。预览版37分,正式版68.7分,翻了近一倍。

打个比方:以前这个模型像一个只会写HTML页面的初级前端,现在它能独立搭出一个带数据库、带登录功能的小网站了。

三、"后训练"到底是怎么做的?拿学开车举个例子

很多人还是觉得"后训练"很抽象。我们换个场景理解——

假设你要训练一个人学会开车:

预训练阶段:给他看一万本驾驶手册、交通法规、汽车构造原理。这时候他理论上知道"红灯停绿灯行""方向盘往左打车子往左转"。但真让他坐进驾驶座,他连刹车和油门都分不清。

后训练阶段:让他实际坐进驾驶座,找个教练陪练。先练倒车入库,练100次,每次停歪了就告诉他"往左回半圈";再练侧方停车,练200次;再练高速变道,练300次……练到肌肉记忆形成,不用想就知道脚该放哪。

DeepSeek的做法就是:不去换一个更聪明的"学员",而是换了一个更好的"教练",设计了一套更科学的练车方案。

这套方案好在哪?它不是让模型做选择题("以下哪项是正确的变道方式?"),而是让模型真的去执行任务("去,把这辆车的Bug修了"),做错了就分析错在哪、重新来。这种"干活→犯错→纠正→再干活"的循环,比死记硬背管用得多。

这就是为什么模型脑子没换,干活能力却涨了6倍——不是它变聪明了,是它终于知道"遇到这种问题该怎么动手"了。

四、那对我有什么用?

说一个最实在的:便宜。

这个模型调用100万个Token(大概相当于让它读完三本《三体》的字数):

  • 普通调用:花1块钱
  • 如果很多内容之前读过、缓存命中了:花2分钱

有开发者实测,用它跑一小时的代码任务,花了不到一块钱。

同时它的价格只有同级别国外模型的几十分之一。

这意味着什么?以前你让AI帮你做一个自动化工作流,比如每天自动抓取新闻、自动整理成表格、自动发邮件,你可能担心成本太高。现在成本低到可以忽略不计,每小时几毛钱。

对于做内容的人、写代码的人、开小店的人,这个模型就像雇了一个24小时不睡觉、工资几乎为零的"数字实习生"。虽然它不是天才,但大部分基础活它能干,而且干得越来越靠谱。

五、这意味着什么?大模型比赛换赛道了

过去两年,所有AI公司都在比一件事:谁家模型更大、参数更多。

你1000亿参数,我就2000亿,他3000亿,像军备竞赛一样。

DeepSeek这次用行动说了一句话:别比谁家脑子大了,比谁家训练得更会干活。

这对小公司是个大好消息。你不需要砸几十亿训练一个超大模型,只要后训练做得好,一个中等规模的模型也能在特定任务上干得很漂亮。

DeepSeek还透露了两个信息:V4-Pro正式版预计8月初上线(性能更强的版本);即将实施峰谷定价(早上9-12点、下午2-6点贵一倍,其他时间便宜)。

峰谷定价这个设计很聪明。就像电费一样,鼓励你把不着急的活安排在晚上跑,成本更低。这对做批量处理任务的人特别友好。

六、一句话总结

大模型能力的上限,不取决于脑子有多大,取决于训练方法有多好。

以前大家觉得"后训练"只是锦上添花。

现在才发现,它才是真正决定一个模型"能不能干活"的关键。

对于普通用户来说,最直接的影响就是:你手上的AI工具会越来越"会用"、越来越便宜。一个能干活、又几乎免费的AI助手,正在变成现实。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
山东航空发放餐食的美女空姐,火了!

山东航空发放餐食的美女空姐,火了!

微微热评
2026-08-03 12:25:59
日本当初将核污水排海,引来全球一片骂声,海鲜一度无人问津。两年过去,其水产品出口不但没崩,反而创下4231亿日元的历史新高。

日本当初将核污水排海,引来全球一片骂声,海鲜一度无人问津。两年过去,其水产品出口不但没崩,反而创下4231亿日元的历史新高。

人生录
2026-08-03 00:20:06
印度宣布“电磁弹射比肩中美”:实验室弹飞一头猪,媒体弹飞一个宇宙

印度宣布“电磁弹射比肩中美”:实验室弹飞一头猪,媒体弹飞一个宇宙

阿芒娱乐说
2026-08-03 11:45:51
10万入场费的“换妻”盛宴:记者冒死暗访,组织者3年狂赚2亿

10万入场费的“换妻”盛宴:记者冒死暗访,组织者3年狂赚2亿

说点事
2026-07-16 11:29:11
被前“伯乐”2次痛骂,默不作声的周星驰,终不再顾及所谓的体面

被前“伯乐”2次痛骂,默不作声的周星驰,终不再顾及所谓的体面

国际阿尝
2026-08-02 12:13:09
被骂多年败家挥霍冉莹颖终于摊牌收入是邹市明5倍独自撑起整个家

被骂多年败家挥霍冉莹颖终于摊牌收入是邹市明5倍独自撑起整个家

乡野小珥
2026-08-03 16:22:18
中东闹剧开启新一轮循环 乌克兰复仇炸死俄空天军司令?

中东闹剧开启新一轮循环 乌克兰复仇炸死俄空天军司令?

西楼饮月
2026-08-02 20:09:33
王虹的顶级奢侈品,开始被全网审判了

王虹的顶级奢侈品,开始被全网审判了

李东阳朋友圈
2026-08-03 14:07:25
吴奇隆成立公司,要赵丽颖出10万元,给她1%的股份。赵丽颖碍于情面,答应了,没想到后来赚了5000万

吴奇隆成立公司,要赵丽颖出10万元,给她1%的股份。赵丽颖碍于情面,答应了,没想到后来赚了5000万

互联网品牌官
2026-07-31 10:16:48
于和伟发文闹乌龙!手写输入看错字,“一日为兵”写成“一日为乒”引热议

于和伟发文闹乌龙!手写输入看错字,“一日为兵”写成“一日为乒”引热议

火山詩话
2026-08-02 07:32:42
韦唯想不到,欺瞒家暴、离世4年的外国前夫,竟给她留了一张好牌

韦唯想不到,欺瞒家暴、离世4年的外国前夫,竟给她留了一张好牌

草莓信箱
2026-08-03 03:51:17
贪官末日来了!中央反腐新规已落地,无论在职退休一律终身追责

贪官末日来了!中央反腐新规已落地,无论在职退休一律终身追责

细说职场
2026-08-03 12:52:27
江苏众多企退老人集体发声!不求退休金相同,只盼这件事公平

江苏众多企退老人集体发声!不求退休金相同,只盼这件事公平

吃货的分享
2026-07-28 12:20:00
上港又有两位久违强员要复出!一人曾留洋欧洲穿十号,值得期待

上港又有两位久违强员要复出!一人曾留洋欧洲穿十号,值得期待

艳儿说电影
2026-08-03 15:42:23
集体新低!通富微电、长电科技、华天科技、兴森科技,后市预期

集体新低!通富微电、长电科技、华天科技、兴森科技,后市预期

长风价值掘金
2026-08-03 16:36:50
关系硬,孙雨轩暗示泰山队代理主帅上面有人,18年就进顶级教练班

关系硬,孙雨轩暗示泰山队代理主帅上面有人,18年就进顶级教练班

石场阿鑫
2026-08-03 16:19:28
随着特鲁姆普11-6登顶,上海大师赛奖金分配出炉,赵心童、吴宜泽收获63万大奖

随着特鲁姆普11-6登顶,上海大师赛奖金分配出炉,赵心童、吴宜泽收获63万大奖

体坛最前线66
2026-08-03 00:05:20
苹果突然调整,新 iPhone 明年大洗牌

苹果突然调整,新 iPhone 明年大洗牌

搞机小帝
2026-08-03 14:41:50
今明两年,公交集团正式员工要硬着陆的准备!

今明两年,公交集团正式员工要硬着陆的准备!

亚哥谈古论今
2026-08-02 17:58:19
郑丽文刚给日本捐完款,高市早苗转头就搞了个大动作!

郑丽文刚给日本捐完款,高市早苗转头就搞了个大动作!

阿天爱旅行
2026-08-02 15:24:40
2026-08-03 17:35:00
破局先锋steven
破局先锋steven
一位互联网老炮
67文章数 0关注度
往期回顾 全部

科技要闻

“像魔法一样”的AI,只卖几分钱

头条要闻

上海一家人搬新房全家身体不适 家属自费检测后背发凉

头条要闻

上海一家人搬新房全家身体不适 家属自费检测后背发凉

体育要闻

常规赛MVP可以衡量常规赛成就吗?

娱乐要闻

奥德赛女主持递麦事件争议又升级了

财经要闻

厦门象屿青岛大火背后

汽车要闻

00后搞钱成功后的第一台车,真的不是BBA

态度原创

本地
时尚
亲子
房产
军事航空

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

夏天穿衣服别太沉闷,试试这几款绿色单品,减龄又不老套

亲子要闻

今天我们从南沙巴瓦回拉萨的路上,路上突然遇到一个沙丘,我们停下来让孩子们在沙丘上骑骆驼,这个夏天我们选择让孩子在大自然里面感...

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

军事要闻

东风系列导弹家族罕见同框画面公开

无障碍浏览 进入关怀版