今年4月,AfterQuery宣布A轮融资时,估值为3亿美元。到了9月,据媒体报道,新一轮融资已经将其估值推至32亿美元。另一家提供训练数据与智能体环境的公司Bespoke Labs,也在今年7月宣布,种子轮与A轮融资合计达到4000万美元。
估值水涨船高,AI数据行业对外界来说却极其不透明。这些公司究竟在卖什么?在硅谷101的一期播客里,在Scale AI负责后训练与评测研究的何允中,以及加州大学伯克利分校博士后、Agents’ Last Exam项目研究者孙一铀,从产业与研究两个视角拆解了这门生意。
![]()
数据公司的基因,比你想的要杂
市面上的数据公司林林总总,何允中给出的分类维度是"基因"。有做招聘出身的,像Mercor、Handshake;Scale AI是传统数商,从众包网络出身;也有做合成数据的新公司;还有最新的一类,是某些领域公司转行做数据。
具身智能是个典型例子。何允中说,很多做模型的公司暂时没赚到钱,但花了大量精力投资做数据,就顺便做起了数据生意。各行各业的人也发现了自己数据的价值,然后转行来做数据公司。
几个大玩家,比如Mercor、Surge AI、Scale AI,基本上试图什么东西都能cover。新秀玩家则把某些领域做得更好,像BigCode或者Snorkel AI,可能比较偏研究跟工程,主要生产代码或工具调用这一类的环境,抓住了今年的风口。
还有更小的公司,甚至不像传统做标注数据的,就是一些数据经纪商。何允中举例说,可能是好莱坞的一个人,他有特别多的版权数据,知道怎么把林林总总不同领域的东西卖出去。最新兴起的就是垂直领域,把一个领域做得特别好,由一些领域专家组成。
招聘公司怎么做数据生意
Mercor是做招聘起家的。何允中介绍,它有自己的自动AI面试产品,主打的重点是能够在比较短的时间内找到足够量的专家,形成专家网络。Surge AI则更多把这件事内部来做。
每个数商都要面临取舍:如果自己完全全职培养人,能力强一点,但灵活度不够,产能可能差一点;如果更多依靠众包网络,灵活性大一点,但每个人的质量比较难保障,这就涉及质检问题。何允中说,Scale AI这些公司的优势在于有一些质检的经验,不光是在数据上,也在人上。
从2024年到现在,对数据的需求发生了比较大的变化。2024年之前,聊数据时大家想到的很多还是人工标注,需要非常多的数据来做pre-training。但从2024年开始,Mercor曾提到,因为Deep Search的兴起,整个行业转移到了所谓的Agentic data(智能体数据)。
何允中补充说,Pre-training还是很重要的。不过从他身边人的兴趣来看,大家经历了一个转向,觉得pre-training干得有点无聊了。o系列模型出来的时候,大家都在做reasoning,发现RL跑通了,一下子兴趣都在RL上。
从打分规则到一整套环境
RL比较有意思的一个问题,是需要一个可验证的信号。可验证的信号在代码或者数学上很简单,选择题答错答对了就知道,或者算一个数字出来。但之后大家就在想,数学可以做RL了,其他领域呢?比如医疗、金融,或者更基础的指令遵循。
这里存在的问题是,它有一些客观标答,不像之前做RLHF(基于人类反馈的强化学习)时,reward model(奖励模型)可能没什么标答,只是把大家的喜好学出来。何允中打了个比方:就好像去答历史考题,历史考题是有标答的,但每个人的写法可能都不太一样,很难做pattern match(模式匹配),就是说A B C D检查你有没有答对。
这个时候就是一个rubric(评分细则)的方式,相当于让一个助教拿着教授写的打分规则来给你打分。因为这个打分规则是提前标好的,是教授写的,所以这个TA也不需要特别聪明。这是整个大模型数据中的一个核心概念,叫Weak-to-strong supervision,能不能用弱模型来监督强模型。它成立的条件就是,有个专家把他脑海里的知识写下来了,这样弱的模型拿着它改卷子就行了。这就是rubric data。
这个东西火了很长一段时间,现在还很重要。但各个专家领域里比较容易获取的rubric,很快就被收得差不多了。Mercor或者Surge AI的崛起,跟这一块的专家rubric有关系。再往前走,大家需要动手了。比如现在做代码模型,或者像孙一铀他们做的ALE,虽然它不是做代码,但它需要"动手",要解各种各样的问题。
这个时候,就不再只是验证一个聊天的输出了,而是需要在一个Agent的环境之下,给它一些工具,还有一些更复杂的验证方式。它还包含了rubric,但可能需要检查这个环境里面的变量是不是执行了,这个数据库是不是写入了,或者被删除了。甚至如果生成一些文档,里面可能有些图,这个东西还是需要rubric,但需要一个agent来检查,它就变得更加多样了。
现在大家追求的比较大的一个方向就是环境。它不光是一些标注好的打分规则,而是包含了一整套"我要做什么"、"在什么样的环境里面做",包括它需要的一些工具,需要执行的一些沙盒,以及还有一套跟task比较相关的验证方式。验证方式非常多样,比如有Programmatic check(程序化检查),有rubric,还有偏好,让人选比较喜欢哪一种。
何允中说,这里面暂时还没有形成特别大的共识。他又看到有点像当年rubric时代,每一家要的东西都不一样。比如Terminal-Bench(终端任务基准),他们就不要rubric,就是纯programmatic。这里面也有不同的流派。
rubric到底做没做到头
孙一铀的看法跟何允中有一点反过来了。何允中认为现在rubric差不多已经做到头了,但孙一铀觉得,rubric这一块,尤其专家那种主观的判断题,其实还做得远远不够。
孙一铀从ALE的初衷讲起。ALE当时建立的初衷,就是怎么把vibe coding迅速发展的趋势推广到vibe everything。当时vibe coding为什么发展那么快?因为有非常非常多的Benchmark(评测基准)都在coding这个领域,而且coding比较容易验证,是一个确定性的rubric。大家为了刷这个榜,所以在coding上面发展非常迅猛。
用同样的思路,如果在其他各个领域上,尤其是工程这些能够客观打分的领域上,能够建立各种各样的评测体系,去刷分,但只要刷的是有益的分,是有意义的题,那它模型带来的提升,对于人的日常工作来说,就是实打实的提升。
这就是当时想建立ALE的初衷。当然世界上大家职业各式各样,实在是太多了,浩如烟海,所以只是在第一个版本里面,给出了一个相对来说覆盖面比较广的初次尝试。孙一铀说,他们还会继续努力,希望把这个覆盖得更广一些。到某一天希望它能成为真正的last exam——当你解决这个benchmark的时候,基本上就能解决人类社会在某些领域的真正的有益的问题。
何允中回应说,他同意孙一铀的观点,各个领域的训练肯定是远远没有到头的,很多东西都可能还没有被rubric的方式表征出来,所以这里面还有很大的空间。他之前说rubric到头了,更多的是个行业趋势,就是这种静态的单轮或者多轮聊天,出一个文本,然后用rubric来检查它,就是纯知识类的。甚至也不是说到头了,因为毕竟还有不同的lab,每家的水平都不一样。
只是说今年的一个大趋势是在做coding,然后coding逐渐转向了Knowledge work,大家要动手了。这个时候,文本的rubric,他看到需求量小了一点,但还是很大,还是有很多东西没解决。
评测和数据,该不该混为一谈
Benchmark和卖数据这两件事情,大家都觉得不能混为一谈。Scale AI之前推出了Humanity’s Last Exam,就是HLE这个评测。
何允中认为,从原理上来说,评测体现的是模型距离我们想要的理想状态中间的gap。它更多的是一个科学研究基准,就是想要模型在哪,它现在没到哪。但这个事情跟卖数据联系起来也比较有意思。因为很多时候,提升这个模型能力的数据,和它榜单的评测方式是息息相关的。这里面比较难的是找到一个平衡。如果生产大量跟这个榜单差不多的数据,那么它可能就在Bench-maxxing。
但大模型训练还是有各种各样的维度,确实如果想要提升某一类的能力,需要抓住某一个维度,那么它跟benchmark肯定是有一定的相关性,这是大家需要找到的一个平衡。因为大家对AGI的期待太高了,觉得人能做到的事情它都能做到,就是说在各种各样的领域都可以想到一些方式构造一个benchmark,然后发现这个模型距离你想象当中还有一些差距。
通常构造这个benchmark的人,对于这一块的领域可能认识比较深,就自然会给他一定卖数据的权威性,大家会比较相信你手上卖的数据。这个生意就这么产生了。何允中说,现在ALE也是做得很火的benchmark,他相信也有不少人想问孙一铀卖不卖数据,或者可能VC也想找他投资,结果逐渐逐渐地就成了一个生意。
何允中觉得也有好有坏。这个生态其实也还比较野蛮发展,有多少是在做科学,多少在做bench-maxxing,确实需要仔细权衡一下。但这确实是有很多的利益驱动,所以现在是个挺繁荣的市场。
孙一铀在这里给大家敲了个警钟。因为何允中提到了,现在做benchmark的人会收到各种各样的诱惑,要把benchmark数据拿去卖。孙一铀甚至私下听到,有一些数据公司踩了这个红线,把自己在做评测的数据去卖。他说,这个是大家千万不能碰的一条线,不能让你做的生意污染你这个benchmark的权威性,不然的话,你不仅毁了你的benchmark,也毁了其他人的模型。
孙一铀个人认为,benchmark和卖数据,这两个东西角色是不一样的,在这个生态系统里的地位是不一样。他认为benchmark面向的是未来,做数据面向的是现在。Benchmark是面向于未来,大家还希望这个模型公司去解决目前还没有解决的什么问题。
ALE其实在今年1月份、2月份做的时候,他们特别害怕benchmark做得太难,导致这个benchmark失去意义,因为当时的模型很多基本上平均分只有10%到20%,大部分题目它都只有拿到零分。孙一铀很担心这样的评测会失去意义。但事实上没有必要担心这个事情,因为benchmark本身要面向于未来的模型去做的。数据的话更多是去解决这个benchmark所产生的一些需求,所以现在大家刷这个榜单,更像是说怎样去把这东西做好。
孙一铀认为,benchmark-maxxing(刷榜)有好有坏,只要面向了它这个数据,它不是直接污染你这个benchmark,你这个benchmark刷的又是有意义的一个榜单,只要这个benchmark和人的真实用户的体验非常接近,他觉得bench-maxxing不一定是一个贬义词。
垂直领域的小团队,机会在哪
关于数据采购,何允中提到了几块问题。首先,最近兴起的这些RL environment公司,其实更多的是在做合成。因为整个数据行业已经从找人标注,慢慢地过渡到你要交付的是一整套环境,然后这个环境可能需要大量的工程工作在里面。很多在这些合成的技术栈上做得比较好的一个小团队,其实可以比较短的时间……
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.