本期嘉宾繁青是 Evolvent AI 联创。他是 01 年的 PhD,曾在 Kimi 做了一年多 RL infra 和 agent,参与 Kimi K2.5、Kimi Linear 等重要模型的发布。Evolvent AI 也是这批数据公司里跑得比较好的几家之一。
本期播客原文约 19000 字,本文经过删减整理后约 6200 字。
编辑整理:陈皮
![]()
曲凯:我们最近聊了很多模型、算法相关的人,发现出来创业的人里,大多是 post-training 背景,而 pre-training 背景的很少。这是为什么?
繁青:做 pre-training 很吃资源,初创公司很难 cover 这块成本。而 post-training 就好很多,路径也比较明确:要么做合成数据,要么做平台类的东西。后者可能有点抽象,可以简单理解成做 bench。
不过现在的 bench 和以前不太一样。
以前主要考模型的推理和做题能力,现在还要考模型在真实环境里的操作能力,比如能不能很好地操作飞书、Notion 等软件。这种 bench 如果做得足够好,很容易转成落地的商业模式。
曲凯:但以前做题和 coding 的那种 bench,可验证性更强,最后对一下结果就行。如果是要造一个环境,该怎么评判结果的好坏?
繁青:会比以前复杂。
首先要确保模拟环境和真实环境是对齐的。举个例子,我们在环境里造了一个 Notion,真实世界里也有一个 Notion,那在输入相同时,两边的输出是不是一样?如果一样,至少能证明这个环境是对的。
另外就是要检查结果。就像你说的,以前可能对个结果就行,但现在得拆出很多维度的小得分点。这些得分点目前还是比较依赖人的精细设计。
曲凯:明白。我最近听到一种说法,说 post-training 的人其实每天主要是在做数据?
繁青:确实,尤其在大厂。举个例子,大厂之外的人要 SFT 一个模型,可能得去 GitHub 拉仓库、找 GPU、配环境、整理数据,再训练。
但在模型厂内部,这一套已经被做成了服务。研究员很多时候只要提交请求,然后等结果就行。在这种情况下,研究员最重要的事就是把数据做好。
曲凯:那 post-training 是不是相对比较枯燥?现在训模型的门槛是不是也没有大家想得那么高了?
繁青:后者我比较认可。对大部分研究员来说,训练模型的门槛确实降低了。但如果你是做 infra,相当于是在做那套服务,里面还是有挺多坑的。
至于 post-training 是不是枯燥,我觉得倒不一定,因为造数据本身很难,即便现在有 agent 参与,不同的人造出来的数据也不一样。
我们最近做了一个 RSI bench,就在讨论 agent 能不能直接完成造数据、迭代训练模型这件事。目前看,agent 只能做一些比较机械的事。比如某批数据导致模型回答格式错了,agent 可以发现并修改。但如果要让它提出造数据的 insight,现在还做不到。而模型厂的研究员在这件事上有很多自己的 know-how,这也是大家的核心能力。
曲凯:不同人做出来的数据好坏,大概体现在哪里?
繁青:最直接的量化标准,是这批数据能不能在模型不作弊的情况下,让模型在目标 benchmark 上提分。
还有一些其他考虑。比如我用代码数据训练模型,它在代码 bench 上提升了,会不会让写作这类偏文科的能力下降?也要看难度是不是适中。太简单的数据没用,太难的数据,模型也学不好。
不过,要正经检验数据质量,还是得拿去训练。训练前,只能做一些初筛。
曲凯:明白。你刚从 Kimi 出来不久,现在 Kimi、MiniMax、智谱这些国内模型厂都在陆续发新模型。你怎么看国内模型现在的发展阶段?大家在拼什么?
繁青:从已经发布的模型来看,国内模型和国外模型的差距在缩小。
当然,具体相差多长时间很难估计,因为国外厂可能有自己的存货没发出来。但比如 Kimi K3,在国内卡可能只有国外十分之一的情况下,效果已经接近 Fable 5 了。
我认为这个结果,主要来自预训练。
国内有限的资源,反而倒逼出了国模在 pre-training 上的架构创新。比如 Kimi Linear、DeepSeek 的 Multi-head Latent Attention,相比于原有的 attention 机制,都是希望用更少的训练资源达到更好的效果。
但在后训练上,国内可能比国外要弱一些。这里的弱不是说技术实力弱,而是像 Anthropic、OpenAI 这些厂,在数据上的积淀更早。国内积淀相对少,所以目前可能会通过蒸馏来补足短板。
曲凯:这和我预想的不太一样。我之前以为,pre-training 部分海外的人才密度更高,卡也远多于国内;而 post-training 更偏工程,理论上应该是国内更有优势的部分。但你认为国内在 pre-training 上更有特色,post-training 反而弱一些?
繁青:对,我和身边一些朋友都比较 buy in 这一点。
预训练更拼研究员的聪明才智。从实际结果看,现在全球范围内比较好的模型架构也就是 Kimi 和 DeepSeek 做出来的,而且它们至少已经在自己的公司里证明了 scale 能力。
而后训练就像你说的,更工程一些。工程上的时间差更难弥补,而且数据积淀比较拼人力和组织。
曲凯:这还蛮有意思的。
那之前智谱在 coding 上长期领先,现在 Kimi K3 出来之后,榜单和反馈都很好。所以后面模型厂还会交替领先吗?尤其像你说的,Kimi 在模型架构上有创新,而且这版也是一个大参数模型。那其他家还有可能很快超过吗?
繁青:只看 bench 上的结果,基本还是会交替领先。但大家相互追赶的过程中肯定有时间 gap,而且真实体感不一定完全一样。
曲凯:所以今天各个模型在拼的,到底是架构创新、数据、infra,还是什么?
我们最近也聊了很多人,我的一个感受是,人才只要肯花钱就可以招,数据只要肯花钱也可以做。那中长期是不是还是拼卡,最后是不是还是大厂更有优势?
繁青:从技术上说,架构、数据、infra 都要拼。
架构决定你能不能在有限资源里榨出更多东西;数据决定你能不能在 benchmark 上达到更好效果;infra 保证内部迭代速度。
不过技术一直在流通,大家的技术水平差异不会特别大。
那长期看,卡当然非常重要。但即便大厂有更多卡,我个人还是更看好初创公司。
因为我觉得最后可能要看组织形态,也就是怎么让公司作为整体跑得更快,比如部门怎么划分更合理、多模态部门到底要不要单独划出来。混元就是一个例子。它在没有改架构的时候可能做得比较差,但现在突飞猛进。
曲凯:说到多模态,有人说,多模态、世界模型不在智力主线上,真正提升模型智力的还是 coding、数学这些。你怎么看?
繁青:这个说法有点绝对。我觉得多模态也应该放到主线上。只是现阶段基于资源考虑,还不太能做全模态优化。而且多模态不像文本信息那样高度压缩,噪声更多,发展起来也会慢很多。
但我相信之后多模态会变得重要,因为 AI 要进入物理世界,还需要视觉、听觉、触觉等各种东西。
曲凯:明白。那现在有没有共识,下一个阶段最核心的是什么?
繁青:现在的共识可能就是 auto research,或者叫 RSI、self-evolving、AI for AI。
目前大众可能更倾向于把 RSI 理解成模型自己迭代自己,得到一个更强的模型;而 auto research 则更像是已经有一个强模型,让它持续迭代做某件事,比如写出一个好的 GPU kernel。
但我认为这些概念说白了都是一件事:
给模型一个工作环境和目标,看它能不能持续操作,拿到结果反馈之后修改之前的操作,最后突破上限。
曲凯:我理解这件事其实有几层可以做。
从最表层的产品结果来讲,可以让模型输出结果后,先不给用户,而是多尝试几次,得到更好的结果之后再给出来。这层应该比较简单,之前也有人在做。
最上层,就是模型能不能自己训练自己。
中间是 harness 部分,也就是怎么让 harness 自己转起来。这层我想多理解一下,因为有人说模型未来会把 harness 一起训进去,就没有所谓 harness 这层了。你怎么看?
繁青:我倒不认为 harness 会不存在。
现在模型厂基本都有自己的 harness,一般会跟着模型一起发版,因为后训练时,模型的输出会经过 harness,反向传播也会让模型越来越适配这个 harness,所以这两者往往会配套出现。当然,我相信 harness 会越来越简单。
曲凯:那未来几年还会有第三方 harness 的空间吗?
繁青:要分情况。
像 coding 这种通用领域,可能确实没有第三方 harness 存在的必要。
但在垂直场景里,一方面大家可能没必要用最强的模型,另一方面也没必要用它们配套的 harness。用一个相对弱的开源模型,配一个简单的 workflow,可能就可以完成需求,而且成本更低、速度更快。这时可能就有第三方 harness 的空间。
曲凯:但如果真能实现 RSI,为什么不用模型自己训一个垂直领域的 harness?以及如果是这样,是不是模型仍然会吃掉一切,还是垂直领域还会有什么价值和壁垒?
繁青:用一个强大的模型写 harness 没毛病,但是这个 harness 未必要接最强的模型。
现在普通用户已经很难感受到新模型能力强弱的差别了,对一些垂直领域来说更是如此。所以大家大可以用强大的模型去指导一个比较小的开源模型,然后在自己的垂直场景上进行迭代,后面就只用这个小的垂域模型。
曲凯:那最终模型商的价值会怎么变化?就像你讲的,现在一些基础模型就已经够用了,最近 GPT 也降价了 80%。那有没有可能直到有一天,大家发现足够使用的模型已经接近免费了?
繁青:我会分两方面来看这个问题。一方面,如果未来真的出现一两家独大的局面,模型价格未必会一直降。因为现在模型降价不一定是因为卡很多、成本低,也可能有商业模式和竞争方面的考虑。毕竟现在开源社区很强,又有竞争对手。
另一方面,垂域还有很多数据隐私需求,不一定有很强的意愿去用 Claude、GPT 这种模型。
曲凯:但我觉得一两家独大,好像目前看起来也不太会发生?
繁青:嗯…不好说。
曲凯:那如果模型真的能自己研发自己,为什么创业公司不直接做一个更好的基模?以及为什么这件事不是模型厂自己做?
繁青:我最近也在思考,所谓 RSI 基模和模型厂正在训的基模,到底是不是正交的。我目前认为,这二者其实是同一件事。所以创业公司去训 RSI 基模,或者去做 RSI 的 harness,都没有太大意义。
曲凯:所以实现 RSI 最核心的点是什么?我能不能理解,只要基模的 coding 能力越来越强,慢慢就能做到?
繁青:我现在对 RSI 的思考是,很多 self-evolving 的方法可以看成一个更聪明版本的 DFS。
DFS 这个算法就相当于让模型走迷宫,遇到死路时再回溯到上一个点。
但在 DFS 里,这个回溯是由代码判断的;而在 RSI 中,是由 LLM 判断的。
而 RSI 的「聪明」,主要就体现在剪枝上。剪枝其实就是要预判一个操作会带来怎样的未来状态,以及这个状态的收益。那在 RSI 中,剪枝的作用就是要让 LLM 把更多精力放到更可能的路上,提高 RSI 的效率。
从技术上说,这件事实现起来,核心靠两个东西:world model 和 value model。这二者在大模型预训练时,已经被内化了。这也是为什么我前面说,我觉得创业公司训「RSI 基模」不太成立。
之后 RSI 变强,一方面要看模型有没有把 world model 的知识内化得更好,另一方面要看模型的 context 窗口有多长。前者决定模型知道多少东西,后者决定模型能回溯到多远的地方。
曲凯:现在模型厂都在往 RSI 这个方向走。假设有一天模型真能做到算法自迭代,数据会不会又变成瓶颈?还是到时候数据也能自己转起来?
繁青:我个人觉得可以转起来。我们最近做的 RSI bench,其实就是在探索这件事。我们目前确实发现,agent 在数据层面展现出了一定的自进化能力,以及自行合成更好数据的能力。
曲凯:我们正好可以捋一下数据的几波发展。我观察到第一波是以 Scale AI 为代表的普通人标注,第二波是 Mercor 那种专家标注数据。合成数据可以理解成当下第三波趋势吗?
繁青:我觉得是,但可能已经在趋势的中后期了。
第一波数据需求更多是为了做预训练,这块目前的需求确实不多了。
第二波对专家数据的需求是 o1 推理范式带来的。这部分依然有需求,但不会像 25 年年初那么多。因为现在模型很强,对专家的要求也变高了。原来可能只要求专家做题,现在还要专家出题,而且题不能和市面上已有题重合,这就太难了。
第三波对合成数据,包括真人数据这块的需求,则是模型 coding 能力变强、开始有更强的 Cowork 能力之后解锁的,主要是为了提升模型的 agent 能力。
曲凯:现在不同类型的数据,大概是什么价格?
繁青:专家数据可能是一两千这个量级。贵的合成数据能卖到好几千,一般就是一条非常长程的任务。真人操控轨迹有时候要走量,就没有单条的说法,因为噪声比较多。
曲凯:合成数据模型厂自己也能做,为什么还要外采?
繁青:数据肯定是多多益善,而且模型厂自己造的数据会有自己人的 bias,所以希望从外面收一批高质量数据,补一下分布。
但合成数据的单子以后肯定会越来越少,主要是因为目前的 bench 越来越少了。
现在模型越来越强,做一个好 benchmark 的难度也非常高,最终可能只会剩下少数几个最好的 benchmark。这样模型厂就可以围绕少数 bench 自己造数据,对外部需求就会少。
曲凯:所以数据还有什么可以做的机会吗?会是什么?
繁青:短期看,可能就是 RSI 数据,比如我用一个模型去后训练另一个小模型。这样一条训练轨迹目前很稀缺,要跑出来也比较难,可能得有模型训练背景的人才能做。所以数据行业的门槛也在提高。
曲凯:所以这半年,包括你们在内的一些公司靠卖数据赚了很多钱,收入涨得蛮快。但你前面说,你觉得这一波已经快进入尾声了?
繁青:对,普通 agent 数据这一波确实已经接近尾声。数据行业变化非常快,也会筛选数据厂商。以前主要走重人力专家标注模式的公司,可能很难活下来。反而是数据公司里有一线 hands-on researcher,可能更能追上数据变化的潮流。
曲凯:但要做好 RSI 数据,就像你前面提的,还是必须自己真的去训模型。
繁青:对。但现在训模型基本约等于造数据。包括我们造数据的时候,也会和模型厂商有合作。
曲凯:我想起来,最近有个蛮流行的说法:「算法就是数据,数据就是 infra,infra 就是算法」。它戏谑之中好像又带着一点真相(笑)。你怎么看?
繁青:没什么毛病。
「算法就是数据」,是因为算法往往会收敛到最简单的形式。当大家都用同样方法时,差异就体现在数据上。
「数据就是 infra」也好理解,因为 infra 决定训练能不能更高效。
「infra 就是算法」,则是因为当我们要训大尺寸、长轨迹模型时,就需要 GPU 层面或者模型 context 层面的并行,才可以训下去。
在这三者之中,数据是核心的驱动力。
现在算法和 infra 的基础形态相对稳定,但它们会跟着数据的需求走。如果以后数据越来越难、推理一条数据都要一天甚至几天,infra 和算法层面也都会跟着改。
曲凯:明白。那你觉得未来大家还会需要更多数据吗?或者大家肯定希望有更多数据,但还能有吗?如果就靠合成数据,那合成数据有没有可能发展成类似无限数据?
繁青:无限是不太可能的。数据量不会毫无节制地提高。
不过高质量数据会一直变多。因为 agent 用户越来越多之后,会反哺出更好的合成数据,再反哺模型训练。而模型尺寸增加之后,模型的效果也会变化,输出的数据质量也会逐步提高。
曲凯:当大家聊到合成数据时,也经常会把它和蒸馏放在一起讲。怎么理解这二者之间的关系?
繁青:生成合成数据时,需要 agent 在一个环境里面探索。如果这个 agent 背后是 Claude 之类的外部模型,大家就会把这个探索过程看成蒸馏。
但蒸馏也分「硬蒸」和「有技巧的蒸」。
硬蒸就是造的环境太简单,比如就是让模型做普通数学题,老师做一遍,学生拿过来抄。
但如果环境足够复杂,对应的题和评分标准又是正确的、足够高质量的,那么搭出这一套环境和题本身就是有难度的。
曲凯:那为什么有些公司会强调自己不蒸馏?蒸馏的坏处是什么?
繁青:蒸馏有点像抄近道,可能会让你错过在主路上本来能发现的一些 insight。
曲凯:明白。所以现在 AI Lab 大概处在什么状态?之前大家会担心 scaling law 撞墙。你觉得现在对 AI Lab 里的人来讲,是沿着现有路线还有很大空间,还是需要新的架构和技术路线?
繁青:从年初到现在,coding 一直是大家最重要的发力方向。这块增长还是很迅速,但整体 pipeline 已经相对稳定。所以 AI Lab 也会探索其他技术路线,比如 auto research。Anthropic 和 OpenAI 现在也都在探索这块,可能是要服务 AI for Science。
曲凯:正好你提到 AI for Science。除了 Anthropic 和 OpenAI,很多人都在做,包括字节 Seed 前一阵也推了 100 个科学家计划。但 AI4S 似乎和模型并不完全处在同一层面上?那为什么大家开始在这上面发力?
繁青:一方面是因为 STEM 领域确实是模型 research 能力比较直接的应用场景。
另一方面,现在已经很难单纯靠常规 benchmark 展现模型智力提升了。AI4S 和让模型写 GPU kernel 一样,都是长程、高难度的任务,是直接衡量模型智力的好场景。模型厂也需要找到这些场景去 PR。
曲凯:就是大家已经要从奥赛卷到诺贝尔奖了(笑)。
最后问一个比较敏感的问题:蒸馏对于国内模型的表现,到底有多大影响?
繁青:我觉得蒸馏不是国内模型变强的决定性因素。
就像前面讲的,我个人认为国内模型变强更多来自底层架构和预训练上的创新。
蒸馏是后训练里的加速手段,但不是说没有 Claude API 就做不出来。国内自己的模型现在也很强了,可以用自己的模型做合成数据。而且国内人这么多,如果真下狠心做数据基建,也不见得做不出来。
蒸馏可以缩短我们追赶的时间,但并不是国模变强的唯一原因,更不是最底层的原因。
42章经
思考事物本质
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.