网易首页 > 网易号 > 正文 申请入驻

一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型|42章经

0
分享至

本期节目的嘉宾逯雨鑫是 Mind Lab 的研究员。此前,他以个人开发者的身份,仅花费数百美元,后训练出了两个登顶 Hugging Face Model Trending 榜的模型。

本期播客原文约 15000 字,本文经过删减整理后约 4800 字。


曲凯:今天大多数人还是觉得训模型是一件非常难的事情,不知道有哪些步骤、具体该怎么做。大家印象中,训模型的人一般也都是各种 PhD、researcher 之类的。但雨鑫你其实不是 AI PhD,此前也没有 AI Lab 的训练经验,为什么能训出两个登顶 Hugging Face 开源模型榜首的小模型?


雨鑫:其实要训出能在工业界用起来的模型,路径是很明确的,没有大家想象中那么难。只要自学一些基础,再加上现在各种 AI 工具的加成,很多人都可以做到。

曲凯:你训练这两版模型,大概花了多少时间和钱?

雨鑫:第一版花了 5 天左右,第二版时间长一些,大概两三周,然后总共花了几百美元。硬件上,我就用了一张 5090。现在租一张 5090,每小时可能只要一两美元,真正训练一次也就是十几个小时。即便迭代几版,硬件成本也不会超过 100 美元。软件上,我用了一个 200 美元的 Claude Max Plan,主要用来合成目标领域的数据。

曲凯:最后训练出来的效果怎么样?

雨鑫:我的模型主要针对 agentic 场景,把对应的 benchmark 从底座模型的 15 分提升到了 55 - 60 分左右。

不过,个人或应用公司训练模型,往往需要做一些取舍。在资源有限的情况下,你可以让模型在目标能力上变强,但其他 benchmark 或多或少会下降。

曲凯:我能不能简单理解成,你的做法就是用更强的 teacher model 生成数据,通过 SFT 蒸馏出一个特定领域的小模型,让它在某些任务上比原来的底座更强?

雨鑫:是的。

曲凯:这听起来并不复杂,但为什么这件事还没有大众化?是我们有盲区、其实很多人已经在做,还是确实做的人不多?

雨鑫:确实没有那么多人做,最主要的原因是大家认为它非常复杂。但其实这件事的流程没有那么难,总共可以分成五步。

第一步:明确自己要做什么。

很多个人开发者上来会先追热点,或者盲目刷 benchmark。但更应该从自己的真实需求出发,想明白要提升模型哪方面的能力。我的项目能火起来,就是因为抓住了有真实需求的场景,选定了 coding 和 agentic 这两个方向,所以模型发布后有很多下载和使用。

第二步:选底座模型。

这里要考虑模型架构、语言能力和具体场景。比如我用的是 Gemma 4 12B,当时就遇到了一些问题,比如它的中文能力比较差、有时会说粤语,而且架构没那么主流,训练过程会很麻烦。

我个人体感上,Qwen 是坑相对比较少的开源模型。

第三步:设计数据管线。

我用到的数据大概有三类:一种是合成数据,就是让一个模型扮演用户,另一个模型回答;一种是开源数据,在 Hugging Face、ModelScope 这样的平台上其实有很多;还有一种是自己或其他真实用户的使用轨迹。我自己用到的真实数据,很多是关注我这个模型的用户主动贡献的。

然后我有一个比较大的经验是,合成数据可能没有那么好,它更像靶向药,适合定向解决某个问题。实际训练时,我 60% - 70% 还是用的真实轨迹数据,遇到具体问题时才用合成数据。

举个例子。我训练时会遇到模型过度自信的问题,就是跑 benchmark 时,模型明明没有真的完成任务,却说自己完成了。要解决这个问题,很难从公开或者日常使用数据中找到合适的选择,就得有针对性地去合成。

第四步:决定训练方法。

现在工业界比较流行的有两种做法,一种是 SFT,简单来说就是把 teacher model 的能力蒸馏到小模型里,实际效果取决于数据质量;另一种是 RL,被吹得很神,但我个人觉得效果不如前者。

当然还有很多别的方法,比如 OPD(Off-Policy Distillation)。但我感觉 RL 和 OPD 的成本都比较高,更适合锦上添花。对很多应用公司和个人来说,SFT 配上好的数据,就已经能完成很多工业场景里的目标了。我自己也是只选择了 SFT 去训练。

第五步:用特定的 benchmark 测试效果并迭代。一版训练出来的效果不好,就从错题和失败轨迹里找原因,调整数据,再训练下一版。

这整套流程并不复杂。过程中需要的训练脚本、数据、benchmark 和环境等,基本都有开源或第三方服务的解决方案。你可以去找合适的方案,把代码拉下来,再借助 agent 改成适合自己模型的版本。实际训练也很快,几个小时就能跑一版。

其中最大的、甚至唯一的难点和卡点就是数据。我自己 95% 的时间都花在这一环。

曲凯:具体难在哪?

雨鑫:难在你得看懂数据出了什么问题,以及该用什么数据去改变它。

拿合成数据来说,现在的模型还不能稳定地合成高质量数据,需要大量人工审核。我做 V2 时花了更多时间,主要就是因为要审数据。假设合成了 5000 条数据,我可能要自己抽查 500 条,然后告诉模型有什么问题,让它重新生成,再继续检查。

曲凯:那你总共用了多少条数据?

雨鑫:我总共整理了接近一万条数据,清洗、筛选之后,用于训练的有几千条。对特定领域的小模型来说,这个量就已经可以产生明显效果了。

曲凯:我们之前和人交流时,经常听人讲,你没办法预先评估数据的效果,都得拿去训练,再回头改。你的经验是怎样的?

雨鑫:这件事确实没什么捷径,只能不断测试和迭代。而且一版没有达到预期非常正常,继续做就好了。

如果你看数据就知道它有问题,那这版训练大概率也不对。

而且即使你和 AI 都检查过,自己抽样也觉得很好,训练出来仍然可能有问题。这背后的一个重要原因是 capacity gap,也就是 teacher model 太强、学生太弱。比如你要把一个 3T 的模型蒸进一个 12B 小模型,很多能力小模型根本学不来。

曲凯:那怎么评估蒸馏的好坏?从工业级角度看,是不是怎么有效、怎么成本低就怎么来?那最基础、最简单的所谓「硬蒸」,是不是反而最好?

雨鑫:评估数据和蒸馏的标准是一样的,就是看你的操作和目标是不是对齐的。

举个例子,假设你想提升模型的安全边界,却只围绕 benchmark 做数据,那即使分数涨了,也不算好的蒸馏。相反,只要你知道自己想做什么,最后也真的把模型的分布往那个方向拉了,即使其他 benchmark 掉分,也是好的蒸馏。

曲凯:明白。那一家公司自己训练一个小模型,大概要多少钱?

雨鑫:几千到一万元人民币以内,就能训练出一个比较符合需求的小模型。如果要训练大一点的模型,卡量就得跟上,可能需要十几万到二十万元。

不过这里说的只是训练成本。真正部署给用户调用是 serving 端的事,里面还有很多坑,需要考虑 infra 架构、并发量和硬件等问题。如果只是几路或十几路并发,我估计一个小模型加一台 H200 就够了。

曲凯:那你觉得未来训练模型会不会变成中大型公司的标配,就像互联网时代都要做前后端一样?

雨鑫:我觉得会。中大型公司配一个三四人的小团队就行,成本主要就是这几个人的工资以及显卡。

小公司如果暂时没预算,可以先找 AI Lab 或第三方服务商合作。等自己的应用真正起来,有了几百万、几千万用户,再组建内部 AI 团队。

不过,我觉得自己训练模型的成本还会继续下降。现在显卡和内存价格还在高点,部分原因是供应没有跟上 AI 的需求。但随着供应跟上,显卡可能像早期的手机流量一样,一开始很贵,后来越来越便宜,最终甚至成为不限量的基础设施。

曲凯:既然每个环节都有第三方或开源方案,为什么还没有人把它们整合成一套完整的 pipeline,让普通人不用学习每个环节,也能训练出自己的小模型?

雨鑫:训模型可能确实会逐渐商品化,你说的也是很多公司都想做的事。其实海外也已经有 Unsloth 这样的公司。包括 Hugging Face 上的 Jobs 平台,也在做这件事。

目前这种服务的价格还不算便宜,infra 和 serving 也有不少问题。而且即便有这样的方案,数据仍然是最重要的一环。训练脚本可以标准化,但理解业务、发现模型的问题、知道该造什么数据,还是需要人来做。

曲凯:那未来 AI 应用公司和模型公司之间的关系会怎么变化?

雨鑫:我觉得 AI Lab 的数量会减少,但少数头部 AI Lab 仍会成为赢家,并掌握很高的价值。一方面,pre-training 依然得有 AI Lab 来做,因为这件事非常吃资源,应用公司未必能搞定。另一方面,很多早期应用公司得先把产品跑起来,再组建团队训练模型。那在此之前,这些公司还是要找 AI Lab 提供服务。

曲凯:你描述的好像还是当下的状态?但如果按照我们刚刚的推理,未来会有很成熟的训练模型的解决方案,应用公司训练模型的门槛可能会比你刚刚讲的低很多?

以及我自己的感觉是,现在 AI Lab 在明确追求更高 level 的事情,比如解决诺贝尔级别的科学问题、AI4S 或具身等问题,或者解锁一些我们现在没想到的场景。而对于很多日常场景来说,也许大家基于开源模型做一个内部模型,就够用了。

所以最近美国红杉也在讲,AI 应用公司未来反而会变成 Neo Lab。

雨鑫:是。至少后训练很可能逐渐被应用公司接管,因为应用公司离用户更近,拥有最真实的数据,也不愿意把自己的核心数据交给别人。那么行业里领先的应用公司,确实可能会长成 Neo Lab 的样子。而且其中的中大型公司,甚至也可能向更小的公司提供 API 或 token plan。

曲凯:这很像推荐算法时代发生过的事情。字节这样的公司是先有应用、场景、商业闭环和用户数据,才有了更好的推荐算法。你很难找到一家第三方公司,说我只做推荐算法。

这也解释了为什么 AI Lab 愿意花很多钱买数据。现在很多人可能还没有意识到数据的价值,就像移动互联网早期,大家不理解为什么公司要花很高的成本买用户,后来才发现越早获取,成本反而越低。

雨鑫:对。AI Lab 买数据,其实就是想知道用户会提出什么问题、AI 在真实场景里怎样完成任务。所以有些公司让用户免费体验新模型,一方面是为了宣传,另一方面也是为了收集真实使用数据,用来迭代下一代模型。

曲凯:是。然后过去一段时间一直有个论调,觉得模型好像会吃掉一切,应用公司的价值很低。前几周,我们录了一期复盘 AI 应用的节目(回顾:),当时我也比较悲观。

但最近聊下来,我反而觉得 AI Lab 和应用公司的价值都在上升。未来某个时间点,模型的价值可能会逐渐向应用公司让渡。

最后我们再聊聊 Local AI 吧。你觉得这会是一个 PC 级别的机会吗?因为计算机刚出现时,一台机器可能要占满整个房间,后来变成每个人都有一台 PC。AI 会不会也从全球只有几家大模型公司,走向每个人都有一个运行在电脑、手机或其他端侧设备上的模型?

雨鑫:我觉得一定会,而且已经在往这个方向发展。

一个非常重要的驱动力就是数据安全。你在调用上游 API 时,数据一定要流经服务提供方。所以对数据敏感的个人和公司会越来越倾向于 Local AI。这里也提醒大家,一些来路不明的中转站价格看起来很便宜,但存在很大的数据泄露风险。

这可能也是为什么千问一直在发布小模型。随着芯片和统一内存继续升级,本地能运行的模型会越来越大,能力也会越来越强,未来很多人都会有自己的本地模型。

陈皮:抱歉我插个问题。我是陈皮,在42章经做内容。我想问,用户最终会不会还是会追求 SOTA?假设 OpenAI、Anthropic 一直在发布最前沿的模型,即使本地模型已经足够完成日常工作,人们真的愿意使用一个离 SOTA 还有差距的模型吗?

雨鑫:这确实是 Local AI 现在最现实的问题。我自己的 Local AI 使用率也不算高,因为它确实还会犯错,能力没有最前沿的模型强。

但 Local AI 的优势有三点:

一是前面提到的,很多人对数据隐私的需求确实很强烈;

二是在一些领域,比如网络安全、生物领域,SOTA 模型会有拒答的问题,所以即使本地模型不是 SOTA,一些用户还是愿意使用,或者说不得不使用;

三是本地模型更便宜。举个例子,我很喜欢武侠小说,会想用 AI 续写或者改编,但这种任务的 token 消耗特别大。如果全部调用 API,成本可能非常高,而用 Local AI 就不太需要额外支付 API 成本,很划算。

曲凯:我补充一个思考角度,就是对用户来说,到底什么算是 SOTA?今天模型能力已经足够解决很多问题了,那继续追求更好的模型,从性价比上未必一直 make sense。就像很多人觉得 4G 已经够用,不一定非要 5G、6G。

雨鑫:不过很多人确实会盲目追求最强的智能,不管自己是否真的需要。

曲凯:但我觉得,最后可能还是豆包这样的产品用户更多。真正关心模型极致能力的人还是少数,大多数用户更关注产品用起来方不方便、性价比是不是足够高。而且 Local AI 未来也未必需要人主动选择,而是会直接被应用公司和硬件公司做进产品里。

最后,在训练模型这块,雨鑫还有什么想补充的吗?

雨鑫:有三个建议。

一是,如果个人或应用公司对训练模型感兴趣,最好的开始时机可能就是现在。因为如果有一天,模型厂商不再开源好的小模型,将会对应用公司造成很大的打击。所以对有预算的中大型应用公司来说,现在就开始基于优秀开源模型做后训练、持续迭代,是更稳妥的选择。

二是,虽然可以借助 AI,但不要过度相信 AI。遇到问题要及时查真实资料,或者看开源社区里已经成功的案例。

最后,别太快放弃。自己训模型的流程里,每个环节都会遇到坑,这非常正常,一版一版迭代就好。

【活动预告】

9 月 12 日,我们会请到雨鑫做一场线上活动,感兴趣的朋友欢迎点击链接或扫描下面的二维码,一起来认识&交流!

42章经

思考事物本质

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
智谱开店,Kimi、MiniMax在路上,从AI到“日用品”的最短距离是天猫?

智谱开店,Kimi、MiniMax在路上,从AI到“日用品”的最短距离是天猫?

智东西
2026-09-04 19:38:26
7个葫芦娃剪掉后第一个清晨:葫芦娃爷爷趴在阳台上打水,葫芦娃没了,流量点没了,现场几乎没人拍了

7个葫芦娃剪掉后第一个清晨:葫芦娃爷爷趴在阳台上打水,葫芦娃没了,流量点没了,现场几乎没人拍了

火山詩话
2026-09-07 05:57:18
又一个有钱人死在了加州的路边,他是年薪百万的阿里总监,才42岁

又一个有钱人死在了加州的路边,他是年薪百万的阿里总监,才42岁

皮蛋儿电影
2026-09-06 16:09:30
启东市卫生健康委员会党组书记、主任苏高飞被查

启东市卫生健康委员会党组书记、主任苏高飞被查

扬子晚报
2026-09-07 12:51:00
“林肯”号航母驶离泰国,官兵5天消费1亿泰铢,除了2名水兵在芭堤雅酒后斗殴外,没发生逮捕案件

“林肯”号航母驶离泰国,官兵5天消费1亿泰铢,除了2名水兵在芭堤雅酒后斗殴外,没发生逮捕案件

鲁中晨报
2026-09-06 20:39:17
“我们怎么落到与朝鲜伊朗为伍的地步?”这个问题问得好!

“我们怎么落到与朝鲜伊朗为伍的地步?”这个问题问得好!

廖保平
2026-09-07 08:38:06
星宇事件再起争端!网友:星宇股份二次“罚”了所有人,却没一个人真疼——这波操作,把打工人当傻子

星宇事件再起争端!网友:星宇股份二次“罚”了所有人,却没一个人真疼——这波操作,把打工人当傻子

火山詩话
2026-09-07 12:46:48
iPhone 18 Pro Max价格曝光 1万2起步顶配2万

iPhone 18 Pro Max价格曝光 1万2起步顶配2万

PChome电脑之家
2026-09-07 11:03:49
严肃警告:不要买!不要吃!里面含有硼砂,危害健康,别害了自己

严肃警告:不要买!不要吃!里面含有硼砂,危害健康,别害了自己

健身狂人
2026-09-06 13:46:44
中科院:江浙沪血液有害物质浓度爆表!

中科院:江浙沪血液有害物质浓度爆表!

生命科学前沿
2024-03-27 17:38:51
“车灯女王”周晓萍,被扣薪12个月

“车灯女王”周晓萍,被扣薪12个月

中国新闻周刊
2026-09-07 13:05:13
演唱会上“衣不遮体”,惹争议!官媒下场,莫文蔚那英也没躲过

演唱会上“衣不遮体”,惹争议!官媒下场,莫文蔚那英也没躲过

皮皮电影
2026-09-05 14:20:16
没有这种食物,你的肌肉将消失!医生:50岁后恢复肌力的5种食物

没有这种食物,你的肌肉将消失!医生:50岁后恢复肌力的5种食物

健康科普365
2026-09-07 11:25:19
中专女生去香港看演唱会全家被取消低保,表姐发帖大呼可怜

中专女生去香港看演唱会全家被取消低保,表姐发帖大呼可怜

新动察
2026-09-07 09:46:22
突发!华为拿下玛莎拉蒂!

突发!华为拿下玛莎拉蒂!

财经要参
2026-09-07 12:00:03
广州图书馆人满为患!大批失业者假装上班,专家痛批:脱不下孔乙己的长衫

广州图书馆人满为患!大批失业者假装上班,专家痛批:脱不下孔乙己的长衫

火山詩话
2026-09-06 15:08:53
这条无耻新闻,终于引起公愤了!

这条无耻新闻,终于引起公愤了!

胖胖说他不胖
2026-09-07 11:50:18
为什么赛车手敢去救人,救援人员却丢下灭火器逃离?

为什么赛车手敢去救人,救援人员却丢下灭火器逃离?

火山口的普林尼
2026-09-06 23:37:56
自残式去中国化!为强拆中国设备,印度大出血,美国进入紧急状态

自残式去中国化!为强拆中国设备,印度大出血,美国进入紧急状态

国际法大视野
2026-09-06 16:02:20
“女孩赴港看演唱会全家低保被取消”引热议,制度底线不能被“热爱”冲垮

“女孩赴港看演唱会全家低保被取消”引热议,制度底线不能被“热爱”冲垮

新民周刊
2026-09-07 16:55:42
2026-09-07 17:51:00
42章经 incentive-icons
42章经
创投圈第一自媒体
77文章数 146关注度
往期回顾 全部

科技要闻

华为Mate XT 2起售价19999元 9月12日开售

头条要闻

"女孩看演唱会被取消低保"引热议 当地人员曾反复劝阻

头条要闻

"女孩看演唱会被取消低保"引热议 当地人员曾反复劝阻

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

家居
教育
艺术
手机
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

年仅46岁!北京44中学生志浩老师意外离世:留给学生的最后一句话,成了永远的遗憾

艺术要闻

色彩很美,简约风景油画!

手机要闻

余承东:建议苹果用户买华为阔直板当备用机 备用几天就可能成为主力机

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版