网易首页 > 网易号 > 正文 申请入驻

从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|42章经

0
分享至

本期嘉宾繁青是 Evolvent AI 联创。他是 01 年的 PhD,曾在 Kimi 做了一年多 RL infra 和 agent,参与 Kimi K2.5、Kimi Linear 等重要模型的发布。Evolvent AI 也是这批数据公司里跑得比较好的几家之一。

本期播客原文约 19000 字,本文经过删减整理后约 6200 字。

编辑整理:陈皮


曲凯:我们最近聊了很多模型、算法相关的人,发现出来创业的人里,大多是 post-training 背景,而 pre-training 背景的很少。这是为什么?

繁青:做 pre-training 很吃资源,初创公司很难 cover 这块成本。而 post-training 就好很多,路径也比较明确:要么做合成数据,要么做平台类的东西。后者可能有点抽象,可以简单理解成做 bench。

不过现在的 bench 和以前不太一样。

以前主要考模型的推理和做题能力,现在还要考模型在真实环境里的操作能力,比如能不能很好地操作飞书、Notion 等软件。这种 bench 如果做得足够好,很容易转成落地的商业模式。

曲凯:但以前做题和 coding 的那种 bench,可验证性更强,最后对一下结果就行。如果是要造一个环境,该怎么评判结果的好坏?

繁青:会比以前复杂。

首先要确保模拟环境和真实环境是对齐的。举个例子,我们在环境里造了一个 Notion,真实世界里也有一个 Notion,那在输入相同时,两边的输出是不是一样?如果一样,至少能证明这个环境是对的。

另外就是要检查结果。就像你说的,以前可能对个结果就行,但现在得拆出很多维度的小得分点。这些得分点目前还是比较依赖人的精细设计。

曲凯:明白。我最近听到一种说法,说 post-training 的人其实每天主要是在做数据?

繁青:确实,尤其在大厂。举个例子,大厂之外的人要 SFT 一个模型,可能得去 GitHub 拉仓库、找 GPU、配环境、整理数据,再训练。

但在模型厂内部,这一套已经被做成了服务。研究员很多时候只要提交请求,然后等结果就行。在这种情况下,研究员最重要的事就是把数据做好。

曲凯:那 post-training 是不是相对比较枯燥?现在训模型的门槛是不是也没有大家想得那么高了?

繁青:后者我比较认可。对大部分研究员来说,训练模型的门槛确实降低了。但如果你是做 infra,相当于是在做那套服务,里面还是有挺多坑的。

至于 post-training 是不是枯燥,我觉得倒不一定,因为造数据本身很难,即便现在有 agent 参与,不同的人造出来的数据也不一样。

我们最近做了一个 RSI bench,就在讨论 agent 能不能直接完成造数据、迭代训练模型这件事。目前看,agent 只能做一些比较机械的事。比如某批数据导致模型回答格式错了,agent 可以发现并修改。但如果要让它提出造数据的 insight,现在还做不到。而模型厂的研究员在这件事上有很多自己的 know-how,这也是大家的核心能力。

曲凯:不同人做出来的数据好坏,大概体现在哪里?

繁青:最直接的量化标准,是这批数据能不能在模型不作弊的情况下,让模型在目标 benchmark 上提分。

还有一些其他考虑。比如我用代码数据训练模型,它在代码 bench 上提升了,会不会让写作这类偏文科的能力下降?也要看难度是不是适中。太简单的数据没用,太难的数据,模型也学不好。

不过,要正经检验数据质量,还是得拿去训练。训练前,只能做一些初筛。

曲凯:明白。你刚从 Kimi 出来不久,现在 Kimi、MiniMax、智谱这些国内模型厂都在陆续发新模型。你怎么看国内模型现在的发展阶段?大家在拼什么?

繁青:从已经发布的模型来看,国内模型和国外模型的差距在缩小。

当然,具体相差多长时间很难估计,因为国外厂可能有自己的存货没发出来。但比如 Kimi K3,在国内卡可能只有国外十分之一的情况下,效果已经接近 Fable 5 了。

我认为这个结果,主要来自预训练。

国内有限的资源,反而倒逼出了国模在 pre-training 上的架构创新。比如 Kimi Linear、DeepSeek 的 Multi-head Latent Attention,相比于原有的 attention 机制,都是希望用更少的训练资源达到更好的效果。

但在后训练上,国内可能比国外要弱一些。这里的弱不是说技术实力弱,而是像 Anthropic、OpenAI 这些厂,在数据上的积淀更早。国内积淀相对少,所以目前可能会通过蒸馏来补足短板。

曲凯:这和我预想的不太一样。我之前以为,pre-training 部分海外的人才密度更高,卡也远多于国内;而 post-training 更偏工程,理论上应该是国内更有优势的部分。但你认为国内在 pre-training 上更有特色,post-training 反而弱一些?

繁青:对,我和身边一些朋友都比较 buy in 这一点。

预训练更拼研究员的聪明才智。从实际结果看,现在全球范围内比较好的模型架构也就是 Kimi 和 DeepSeek 做出来的,而且它们至少已经在自己的公司里证明了 scale 能力。

而后训练就像你说的,更工程一些。工程上的时间差更难弥补,而且数据积淀比较拼人力和组织。

曲凯:这还蛮有意思的。

那之前智谱在 coding 上长期领先,现在 Kimi K3 出来之后,榜单和反馈都很好。所以后面模型厂还会交替领先吗?尤其像你说的,Kimi 在模型架构上有创新,而且这版也是一个大参数模型。那其他家还有可能很快超过吗?

繁青:只看 bench 上的结果,基本还是会交替领先。但大家相互追赶的过程中肯定有时间 gap,而且真实体感不一定完全一样。

曲凯:所以今天各个模型在拼的,到底是架构创新、数据、infra,还是什么?

我们最近也聊了很多人,我的一个感受是,人才只要肯花钱就可以招,数据只要肯花钱也可以做。那中长期是不是还是拼卡,最后是不是还是大厂更有优势?

繁青:从技术上说,架构、数据、infra 都要拼。

架构决定你能不能在有限资源里榨出更多东西;数据决定你能不能在 benchmark 上达到更好效果;infra 保证内部迭代速度。

不过技术一直在流通,大家的技术水平差异不会特别大。

那长期看,卡当然非常重要。但即便大厂有更多卡,我个人还是更看好初创公司。

因为我觉得最后可能要看组织形态,也就是怎么让公司作为整体跑得更快,比如部门怎么划分更合理、多模态部门到底要不要单独划出来。混元就是一个例子。它在没有改架构的时候可能做得比较差,但现在突飞猛进。

曲凯:说到多模态,有人说,多模态、世界模型不在智力主线上,真正提升模型智力的还是 coding、数学这些。你怎么看?

繁青:这个说法有点绝对。我觉得多模态也应该放到主线上。只是现阶段基于资源考虑,还不太能做全模态优化。而且多模态不像文本信息那样高度压缩,噪声更多,发展起来也会慢很多。

但我相信之后多模态会变得重要,因为 AI 要进入物理世界,还需要视觉、听觉、触觉等各种东西。

曲凯:明白。那现在有没有共识,下一个阶段最核心的是什么?

繁青:现在的共识可能就是 auto research,或者叫 RSI、self-evolving、AI for AI。

目前大众可能更倾向于把 RSI 理解成模型自己迭代自己,得到一个更强的模型;而 auto research 则更像是已经有一个强模型,让它持续迭代做某件事,比如写出一个好的 GPU kernel。

但我认为这些概念说白了都是一件事:

给模型一个工作环境和目标,看它能不能持续操作,拿到结果反馈之后修改之前的操作,最后突破上限。

曲凯:我理解这件事其实有几层可以做。

从最表层的产品结果来讲,可以让模型输出结果后,先不给用户,而是多尝试几次,得到更好的结果之后再给出来。这层应该比较简单,之前也有人在做。

最上层,就是模型能不能自己训练自己。

中间是 harness 部分,也就是怎么让 harness 自己转起来。这层我想多理解一下,因为有人说模型未来会把 harness 一起训进去,就没有所谓 harness 这层了。你怎么看?

繁青:我倒不认为 harness 会不存在。

现在模型厂基本都有自己的 harness,一般会跟着模型一起发版,因为后训练时,模型的输出会经过 harness,反向传播也会让模型越来越适配这个 harness,所以这两者往往会配套出现。当然,我相信 harness 会越来越简单。

曲凯:那未来几年还会有第三方 harness 的空间吗?

繁青:要分情况。

像 coding 这种通用领域,可能确实没有第三方 harness 存在的必要。

但在垂直场景里,一方面大家可能没必要用最强的模型,另一方面也没必要用它们配套的 harness。用一个相对弱的开源模型,配一个简单的 workflow,可能就可以完成需求,而且成本更低、速度更快。这时可能就有第三方 harness 的空间。

曲凯:但如果真能实现 RSI,为什么不用模型自己训一个垂直领域的 harness?以及如果是这样,是不是模型仍然会吃掉一切,还是垂直领域还会有什么价值和壁垒?

繁青:用一个强大的模型写 harness 没毛病,但是这个 harness 未必要接最强的模型。

现在普通用户已经很难感受到新模型能力强弱的差别了,对一些垂直领域来说更是如此。所以大家大可以用强大的模型去指导一个比较小的开源模型,然后在自己的垂直场景上进行迭代,后面就只用这个小的垂域模型。

曲凯:那最终模型商的价值会怎么变化?就像你讲的,现在一些基础模型就已经够用了,最近 GPT 也降价了 80%。那有没有可能直到有一天,大家发现足够使用的模型已经接近免费了?

繁青:我会分两方面来看这个问题。一方面,如果未来真的出现一两家独大的局面,模型价格未必会一直降。因为现在模型降价不一定是因为卡很多、成本低,也可能有商业模式和竞争方面的考虑。毕竟现在开源社区很强,又有竞争对手。

另一方面,垂域还有很多数据隐私需求,不一定有很强的意愿去用 Claude、GPT 这种模型。

曲凯:但我觉得一两家独大,好像目前看起来也不太会发生?

繁青:嗯…不好说。

曲凯:那如果模型真的能自己研发自己,为什么创业公司不直接做一个更好的基模?以及为什么这件事不是模型厂自己做?

繁青:我最近也在思考,所谓 RSI 基模和模型厂正在训的基模,到底是不是正交的。我目前认为,这二者其实是同一件事。所以创业公司去训 RSI 基模,或者去做 RSI 的 harness,都没有太大意义。

曲凯:所以实现 RSI 最核心的点是什么?我能不能理解,只要基模的 coding 能力越来越强,慢慢就能做到?

繁青:我现在对 RSI 的思考是,很多 self-evolving 的方法可以看成一个更聪明版本的 DFS。

DFS 这个算法就相当于让模型走迷宫,遇到死路时再回溯到上一个点。

但在 DFS 里,这个回溯是由代码判断的;而在 RSI 中,是由 LLM 判断的。

而 RSI 的「聪明」,主要就体现在剪枝上。剪枝其实就是要预判一个操作会带来怎样的未来状态,以及这个状态的收益。那在 RSI 中,剪枝的作用就是要让 LLM 把更多精力放到更可能的路上,提高 RSI 的效率。

从技术上说,这件事实现起来,核心靠两个东西:world model 和 value model。这二者在大模型预训练时,已经被内化了。这也是为什么我前面说,我觉得创业公司训「RSI 基模」不太成立。

之后 RSI 变强,一方面要看模型有没有把 world model 的知识内化得更好,另一方面要看模型的 context 窗口有多长。前者决定模型知道多少东西,后者决定模型能回溯到多远的地方。

曲凯:现在模型厂都在往 RSI 这个方向走。假设有一天模型真能做到算法自迭代,数据会不会又变成瓶颈?还是到时候数据也能自己转起来?

繁青:我个人觉得可以转起来。我们最近做的 RSI bench,其实就是在探索这件事。我们目前确实发现,agent 在数据层面展现出了一定的自进化能力,以及自行合成更好数据的能力。

曲凯:我们正好可以捋一下数据的几波发展。我观察到第一波是以 Scale AI 为代表的普通人标注,第二波是 Mercor 那种专家标注数据。合成数据可以理解成当下第三波趋势吗?

繁青:我觉得是,但可能已经在趋势的中后期了。

第一波数据需求更多是为了做预训练,这块目前的需求确实不多了。

第二波对专家数据的需求是 o1 推理范式带来的。这部分依然有需求,但不会像 25 年年初那么多。因为现在模型很强,对专家的要求也变高了。原来可能只要求专家做题,现在还要专家出题,而且题不能和市面上已有题重合,这就太难了。

第三波对合成数据,包括真人数据这块的需求,则是模型 coding 能力变强、开始有更强的 Cowork 能力之后解锁的,主要是为了提升模型的 agent 能力。

曲凯:现在不同类型的数据,大概是什么价格?

繁青:专家数据可能是一两千这个量级。贵的合成数据能卖到好几千,一般就是一条非常长程的任务。真人操控轨迹有时候要走量,就没有单条的说法,因为噪声比较多。

曲凯:合成数据模型厂自己也能做,为什么还要外采?

繁青:数据肯定是多多益善,而且模型厂自己造的数据会有自己人的 bias,所以希望从外面收一批高质量数据,补一下分布。

但合成数据的单子以后肯定会越来越少,主要是因为目前的 bench 越来越少了。

现在模型越来越强,做一个好 benchmark 的难度也非常高,最终可能只会剩下少数几个最好的 benchmark。这样模型厂就可以围绕少数 bench 自己造数据,对外部需求就会少。

曲凯:所以数据还有什么可以做的机会吗?会是什么?

繁青:短期看,可能就是 RSI 数据,比如我用一个模型去后训练另一个小模型。这样一条训练轨迹目前很稀缺,要跑出来也比较难,可能得有模型训练背景的人才能做。所以数据行业的门槛也在提高。

曲凯:所以这半年,包括你们在内的一些公司靠卖数据赚了很多钱,收入涨得蛮快。但你前面说,你觉得这一波已经快进入尾声了?

繁青:对,普通 agent 数据这一波确实已经接近尾声。数据行业变化非常快,也会筛选数据厂商。以前主要走重人力专家标注模式的公司,可能很难活下来。反而是数据公司里有一线 hands-on researcher,可能更能追上数据变化的潮流。

曲凯:但要做好 RSI 数据,就像你前面提的,还是必须自己真的去训模型。

繁青:对。但现在训模型基本约等于造数据。包括我们造数据的时候,也会和模型厂商有合作。

曲凯:我想起来,最近有个蛮流行的说法:「算法就是数据,数据就是 infra,infra 就是算法」。它戏谑之中好像又带着一点真相(笑)。你怎么看?

繁青:没什么毛病。

「算法就是数据」,是因为算法往往会收敛到最简单的形式。当大家都用同样方法时,差异就体现在数据上。

「数据就是 infra」也好理解,因为 infra 决定训练能不能更高效。

「infra 就是算法」,则是因为当我们要训大尺寸、长轨迹模型时,就需要 GPU 层面或者模型 context 层面的并行,才可以训下去。

在这三者之中,数据是核心的驱动力。

现在算法和 infra 的基础形态相对稳定,但它们会跟着数据的需求走。如果以后数据越来越难、推理一条数据都要一天甚至几天,infra 和算法层面也都会跟着改。

曲凯:明白。那你觉得未来大家还会需要更多数据吗?或者大家肯定希望有更多数据,但还能有吗?如果就靠合成数据,那合成数据有没有可能发展成类似无限数据?

繁青:无限是不太可能的。数据量不会毫无节制地提高。

不过高质量数据会一直变多。因为 agent 用户越来越多之后,会反哺出更好的合成数据,再反哺模型训练。而模型尺寸增加之后,模型的效果也会变化,输出的数据质量也会逐步提高。

曲凯:当大家聊到合成数据时,也经常会把它和蒸馏放在一起讲。怎么理解这二者之间的关系?

繁青:生成合成数据时,需要 agent 在一个环境里面探索。如果这个 agent 背后是 Claude 之类的外部模型,大家就会把这个探索过程看成蒸馏。

但蒸馏也分「硬蒸」和「有技巧的蒸」。

硬蒸就是造的环境太简单,比如就是让模型做普通数学题,老师做一遍,学生拿过来抄。

但如果环境足够复杂,对应的题和评分标准又是正确的、足够高质量的,那么搭出这一套环境和题本身就是有难度的。

曲凯:那为什么有些公司会强调自己不蒸馏?蒸馏的坏处是什么?

繁青:蒸馏有点像抄近道,可能会让你错过在主路上本来能发现的一些 insight。

曲凯:明白。所以现在 AI Lab 大概处在什么状态?之前大家会担心 scaling law 撞墙。你觉得现在对 AI Lab 里的人来讲,是沿着现有路线还有很大空间,还是需要新的架构和技术路线?

繁青:从年初到现在,coding 一直是大家最重要的发力方向。这块增长还是很迅速,但整体 pipeline 已经相对稳定。所以 AI Lab 也会探索其他技术路线,比如 auto research。Anthropic 和 OpenAI 现在也都在探索这块,可能是要服务 AI for Science。

曲凯:正好你提到 AI for Science。除了 Anthropic 和 OpenAI,很多人都在做,包括字节 Seed 前一阵也推了 100 个科学家计划。但 AI4S 似乎和模型并不完全处在同一层面上?那为什么大家开始在这上面发力?

繁青:一方面是因为 STEM 领域确实是模型 research 能力比较直接的应用场景。

另一方面,现在已经很难单纯靠常规 benchmark 展现模型智力提升了。AI4S 和让模型写 GPU kernel 一样,都是长程、高难度的任务,是直接衡量模型智力的好场景。模型厂也需要找到这些场景去 PR。

曲凯:就是大家已经要从奥赛卷到诺贝尔奖了(笑)。

最后问一个比较敏感的问题:蒸馏对于国内模型的表现,到底有多大影响?

繁青:我觉得蒸馏不是国内模型变强的决定性因素。

就像前面讲的,我个人认为国内模型变强更多来自底层架构和预训练上的创新。

蒸馏是后训练里的加速手段,但不是说没有 Claude API 就做不出来。国内自己的模型现在也很强了,可以用自己的模型做合成数据。而且国内人这么多,如果真下狠心做数据基建,也不见得做不出来。

蒸馏可以缩短我们追赶的时间,但并不是国模变强的唯一原因,更不是最底层的原因。

42章经

思考事物本质

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
15亿欧大巴黎蒙羞!0-1输2亿欧黑马:无缘法超杯5连冠 被批太傲慢

15亿欧大巴黎蒙羞!0-1输2亿欧黑马:无缘法超杯5连冠 被批太傲慢

风过乡
2026-08-17 06:24:19
青岛大学“旭日旗校徽”真相大白:35岁男子被拘留!

青岛大学“旭日旗校徽”真相大白:35岁男子被拘留!

听心堂
2026-08-16 09:28:43
顶尖神经科学家科赫,对意识本质提出一项颠覆性的科学思考

顶尖神经科学家科赫,对意识本质提出一项颠覆性的科学思考

心中的麦田
2026-08-15 20:28:05
瞒不住了?李小冉5亿宠婚骗局曝光,11年丁克崩盘,郭京飞一针见血

瞒不住了?李小冉5亿宠婚骗局曝光,11年丁克崩盘,郭京飞一针见血

荒野老五
2026-08-15 22:46:34
2026年了,为什么国家突然要再扫黑一年?因为有种“不动刀的鬼”

2026年了,为什么国家突然要再扫黑一年?因为有种“不动刀的鬼”

天气观察站
2026-08-15 01:36:24
两性心理学:房事上女人不怕肢体接触,怕的是男人这两个“骚操作”

两性心理学:房事上女人不怕肢体接触,怕的是男人这两个“骚操作”

心理观察局
2026-08-17 06:45:11
腾讯音乐被逼到墙角,一款免费App救得了半条命吗

腾讯音乐被逼到墙角,一款免费App救得了半条命吗

呼呼历史论
2026-08-16 12:03:18
媒体预测勇士将与4届总冠军、4届全明星球员分道扬镳

媒体预测勇士将与4届总冠军、4届全明星球员分道扬镳

夜白侃球
2026-08-16 10:43:48
郭德纲结局基本锁定!最高罚3万?后果远比想象严重

郭德纲结局基本锁定!最高罚3万?后果远比想象严重

李云飞Afey
2026-08-14 12:01:45
黄金史诗级暴跌!一边散户恐慌割肉,一边央行越跌越买

黄金史诗级暴跌!一边散户恐慌割肉,一边央行越跌越买

流苏晚晴
2026-08-16 14:20:13
这才是地球禁区?30秒全身细胞被毁,剧毒万年不散,内部画面曝光

这才是地球禁区?30秒全身细胞被毁,剧毒万年不散,内部画面曝光

心中的麦田
2026-08-14 22:48:09
女子投诉“快递未送货上门” 电话被快递员发到征婚群;律师:故意非法泄露、公开他人隐私,涉嫌违法

女子投诉“快递未送货上门” 电话被快递员发到征婚群;律师:故意非法泄露、公开他人隐私,涉嫌违法

大风新闻
2026-08-16 22:30:16
5年来首次负增长!知名老牌子卖不动了?下半年拟多砸7.8亿打广告

5年来首次负增长!知名老牌子卖不动了?下半年拟多砸7.8亿打广告

财经八卦
2026-08-16 17:55:31
印度记者吐槽国羽:陈雨菲满嘴套话,石宇奇宁可被罚款也不配合采访

印度记者吐槽国羽:陈雨菲满嘴套话,石宇奇宁可被罚款也不配合采访

杨华评论
2026-08-17 02:41:24
13秒12,吴艳妮再夺全锦赛100米栏冠军

13秒12,吴艳妮再夺全锦赛100米栏冠军

极目新闻
2026-08-16 21:27:16
若不出意外,明年开始,中国的二手房或将面临这3个结局,很扎心

若不出意外,明年开始,中国的二手房或将面临这3个结局,很扎心

巢客HOME
2026-08-17 05:55:05
六台记者:巴萨预计未来几小时内展开行动,了解哲凯赖什情况

六台记者:巴萨预计未来几小时内展开行动,了解哲凯赖什情况

懂球帝
2026-08-17 07:26:14
打脸好痛!江苏高考全面超过浙江,网友:真实数据使苏大强崩溃

打脸好痛!江苏高考全面超过浙江,网友:真实数据使苏大强崩溃

史海流年号
2026-08-16 07:22:48
全球狂砍70多亿票房,在中国首映即被《龙餐馆》干趴,第二天上座率又被《八仙》反超,观众愿看《牛来》都不看《奥德赛》?

全球狂砍70多亿票房,在中国首映即被《龙餐馆》干趴,第二天上座率又被《八仙》反超,观众愿看《牛来》都不看《奥德赛》?

娱乐故事
2026-08-16 00:00:08
保罗·乔治首次参观凯尔特人训练馆:为你们付出一切,欣喜若狂

保罗·乔治首次参观凯尔特人训练馆:为你们付出一切,欣喜若狂

好火子
2026-08-17 05:21:42
2026-08-17 07:36:49
42章经 incentive-icons
42章经
创投圈第一自媒体
75文章数 146关注度
往期回顾 全部

科技要闻

210亿美元,黄仁勋投了马斯克

头条要闻

如是书院被关停:22岁女生被打疯 大小便失禁生死不明

头条要闻

如是书院被关停:22岁女生被打疯 大小便失禁生死不明

体育要闻

因莫比莱:普通人的平凡故事

娱乐要闻

谷爱凌发文否认恋情:“散了散了”

财经要闻

事关8万亿养老金!长周期考核落地中

汽车要闻

杨洋成001号车主 岚图追光S正式上市

态度原创

本地
时尚
艺术
教育
房产

本地新闻

黄景藏用半刀泥刻瓷都魂

不再执着于“孔乙己的长衫”?年青一代正在成为“新蓝领”

艺术要闻

看看康生真迹,才知什么叫“眼高于顶”

教育要闻

15人! 忻州一中学招聘教师

房产要闻

金茂、招商,海南多个岗位招人!

无障碍浏览 进入关怀版