网易首页 > 网易号 > 正文 申请入驻

估值从3亿飙到32亿,谁在给大模型出题卖题判卷?

0
分享至

今年4月,AfterQuery宣布A轮融资时,估值为3亿美元。到了9月,据媒体报道,新一轮融资已经将其估值推至32亿美元。另一家提供训练数据与智能体环境的公司Bespoke Labs,也在今年7月宣布,种子轮与A轮融资合计达到4000万美元。

估值水涨船高,AI数据行业对外界来说却极其不透明。这些公司究竟在卖什么?在硅谷101的一期播客里,在Scale AI负责后训练与评测研究的何允中,以及加州大学伯克利分校博士后、Agents’ Last Exam项目研究者孙一铀,从产业与研究两个视角拆解了这门生意。


数据公司的基因,比你想的要杂

市面上的数据公司林林总总,何允中给出的分类维度是"基因"。有做招聘出身的,像Mercor、Handshake;Scale AI是传统数商,从众包网络出身;也有做合成数据的新公司;还有最新的一类,是某些领域公司转行做数据。

具身智能是个典型例子。何允中说,很多做模型的公司暂时没赚到钱,但花了大量精力投资做数据,就顺便做起了数据生意。各行各业的人也发现了自己数据的价值,然后转行来做数据公司。

几个大玩家,比如Mercor、Surge AI、Scale AI,基本上试图什么东西都能cover。新秀玩家则把某些领域做得更好,像BigCode或者Snorkel AI,可能比较偏研究跟工程,主要生产代码或工具调用这一类的环境,抓住了今年的风口。

还有更小的公司,甚至不像传统做标注数据的,就是一些数据经纪商。何允中举例说,可能是好莱坞的一个人,他有特别多的版权数据,知道怎么把林林总总不同领域的东西卖出去。最新兴起的就是垂直领域,把一个领域做得特别好,由一些领域专家组成。

招聘公司怎么做数据生意

Mercor是做招聘起家的。何允中介绍,它有自己的自动AI面试产品,主打的重点是能够在比较短的时间内找到足够量的专家,形成专家网络。Surge AI则更多把这件事内部来做。

每个数商都要面临取舍:如果自己完全全职培养人,能力强一点,但灵活度不够,产能可能差一点;如果更多依靠众包网络,灵活性大一点,但每个人的质量比较难保障,这就涉及质检问题。何允中说,Scale AI这些公司的优势在于有一些质检的经验,不光是在数据上,也在人上。

从2024年到现在,对数据的需求发生了比较大的变化。2024年之前,聊数据时大家想到的很多还是人工标注,需要非常多的数据来做pre-training。但从2024年开始,Mercor曾提到,因为Deep Search的兴起,整个行业转移到了所谓的Agentic data(智能体数据)。

何允中补充说,Pre-training还是很重要的。不过从他身边人的兴趣来看,大家经历了一个转向,觉得pre-training干得有点无聊了。o系列模型出来的时候,大家都在做reasoning,发现RL跑通了,一下子兴趣都在RL上。

从打分规则到一整套环境

RL比较有意思的一个问题,是需要一个可验证的信号。可验证的信号在代码或者数学上很简单,选择题答错答对了就知道,或者算一个数字出来。但之后大家就在想,数学可以做RL了,其他领域呢?比如医疗、金融,或者更基础的指令遵循。

这里存在的问题是,它有一些客观标答,不像之前做RLHF(基于人类反馈的强化学习)时,reward model(奖励模型)可能没什么标答,只是把大家的喜好学出来。何允中打了个比方:就好像去答历史考题,历史考题是有标答的,但每个人的写法可能都不太一样,很难做pattern match(模式匹配),就是说A B C D检查你有没有答对。

这个时候就是一个rubric(评分细则)的方式,相当于让一个助教拿着教授写的打分规则来给你打分。因为这个打分规则是提前标好的,是教授写的,所以这个TA也不需要特别聪明。这是整个大模型数据中的一个核心概念,叫Weak-to-strong supervision,能不能用弱模型来监督强模型。它成立的条件就是,有个专家把他脑海里的知识写下来了,这样弱的模型拿着它改卷子就行了。这就是rubric data。

这个东西火了很长一段时间,现在还很重要。但各个专家领域里比较容易获取的rubric,很快就被收得差不多了。Mercor或者Surge AI的崛起,跟这一块的专家rubric有关系。再往前走,大家需要动手了。比如现在做代码模型,或者像孙一铀他们做的ALE,虽然它不是做代码,但它需要"动手",要解各种各样的问题。

这个时候,就不再只是验证一个聊天的输出了,而是需要在一个Agent的环境之下,给它一些工具,还有一些更复杂的验证方式。它还包含了rubric,但可能需要检查这个环境里面的变量是不是执行了,这个数据库是不是写入了,或者被删除了。甚至如果生成一些文档,里面可能有些图,这个东西还是需要rubric,但需要一个agent来检查,它就变得更加多样了。

现在大家追求的比较大的一个方向就是环境。它不光是一些标注好的打分规则,而是包含了一整套"我要做什么"、"在什么样的环境里面做",包括它需要的一些工具,需要执行的一些沙盒,以及还有一套跟task比较相关的验证方式。验证方式非常多样,比如有Programmatic check(程序化检查),有rubric,还有偏好,让人选比较喜欢哪一种。

何允中说,这里面暂时还没有形成特别大的共识。他又看到有点像当年rubric时代,每一家要的东西都不一样。比如Terminal-Bench(终端任务基准),他们就不要rubric,就是纯programmatic。这里面也有不同的流派。

rubric到底做没做到头

孙一铀的看法跟何允中有一点反过来了。何允中认为现在rubric差不多已经做到头了,但孙一铀觉得,rubric这一块,尤其专家那种主观的判断题,其实还做得远远不够。

孙一铀从ALE的初衷讲起。ALE当时建立的初衷,就是怎么把vibe coding迅速发展的趋势推广到vibe everything。当时vibe coding为什么发展那么快?因为有非常非常多的Benchmark(评测基准)都在coding这个领域,而且coding比较容易验证,是一个确定性的rubric。大家为了刷这个榜,所以在coding上面发展非常迅猛。

用同样的思路,如果在其他各个领域上,尤其是工程这些能够客观打分的领域上,能够建立各种各样的评测体系,去刷分,但只要刷的是有益的分,是有意义的题,那它模型带来的提升,对于人的日常工作来说,就是实打实的提升。

这就是当时想建立ALE的初衷。当然世界上大家职业各式各样,实在是太多了,浩如烟海,所以只是在第一个版本里面,给出了一个相对来说覆盖面比较广的初次尝试。孙一铀说,他们还会继续努力,希望把这个覆盖得更广一些。到某一天希望它能成为真正的last exam——当你解决这个benchmark的时候,基本上就能解决人类社会在某些领域的真正的有益的问题。

何允中回应说,他同意孙一铀的观点,各个领域的训练肯定是远远没有到头的,很多东西都可能还没有被rubric的方式表征出来,所以这里面还有很大的空间。他之前说rubric到头了,更多的是个行业趋势,就是这种静态的单轮或者多轮聊天,出一个文本,然后用rubric来检查它,就是纯知识类的。甚至也不是说到头了,因为毕竟还有不同的lab,每家的水平都不一样。

只是说今年的一个大趋势是在做coding,然后coding逐渐转向了Knowledge work,大家要动手了。这个时候,文本的rubric,他看到需求量小了一点,但还是很大,还是有很多东西没解决。

评测和数据,该不该混为一谈

Benchmark和卖数据这两件事情,大家都觉得不能混为一谈。Scale AI之前推出了Humanity’s Last Exam,就是HLE这个评测。

何允中认为,从原理上来说,评测体现的是模型距离我们想要的理想状态中间的gap。它更多的是一个科学研究基准,就是想要模型在哪,它现在没到哪。但这个事情跟卖数据联系起来也比较有意思。因为很多时候,提升这个模型能力的数据,和它榜单的评测方式是息息相关的。这里面比较难的是找到一个平衡。如果生产大量跟这个榜单差不多的数据,那么它可能就在Bench-maxxing。

但大模型训练还是有各种各样的维度,确实如果想要提升某一类的能力,需要抓住某一个维度,那么它跟benchmark肯定是有一定的相关性,这是大家需要找到的一个平衡。因为大家对AGI的期待太高了,觉得人能做到的事情它都能做到,就是说在各种各样的领域都可以想到一些方式构造一个benchmark,然后发现这个模型距离你想象当中还有一些差距。

通常构造这个benchmark的人,对于这一块的领域可能认识比较深,就自然会给他一定卖数据的权威性,大家会比较相信你手上卖的数据。这个生意就这么产生了。何允中说,现在ALE也是做得很火的benchmark,他相信也有不少人想问孙一铀卖不卖数据,或者可能VC也想找他投资,结果逐渐逐渐地就成了一个生意。

何允中觉得也有好有坏。这个生态其实也还比较野蛮发展,有多少是在做科学,多少在做bench-maxxing,确实需要仔细权衡一下。但这确实是有很多的利益驱动,所以现在是个挺繁荣的市场。

孙一铀在这里给大家敲了个警钟。因为何允中提到了,现在做benchmark的人会收到各种各样的诱惑,要把benchmark数据拿去卖。孙一铀甚至私下听到,有一些数据公司踩了这个红线,把自己在做评测的数据去卖。他说,这个是大家千万不能碰的一条线,不能让你做的生意污染你这个benchmark的权威性,不然的话,你不仅毁了你的benchmark,也毁了其他人的模型。

孙一铀个人认为,benchmark和卖数据,这两个东西角色是不一样的,在这个生态系统里的地位是不一样。他认为benchmark面向的是未来,做数据面向的是现在。Benchmark是面向于未来,大家还希望这个模型公司去解决目前还没有解决的什么问题。

ALE其实在今年1月份、2月份做的时候,他们特别害怕benchmark做得太难,导致这个benchmark失去意义,因为当时的模型很多基本上平均分只有10%到20%,大部分题目它都只有拿到零分。孙一铀很担心这样的评测会失去意义。但事实上没有必要担心这个事情,因为benchmark本身要面向于未来的模型去做的。数据的话更多是去解决这个benchmark所产生的一些需求,所以现在大家刷这个榜单,更像是说怎样去把这东西做好。

孙一铀认为,benchmark-maxxing(刷榜)有好有坏,只要面向了它这个数据,它不是直接污染你这个benchmark,你这个benchmark刷的又是有意义的一个榜单,只要这个benchmark和人的真实用户的体验非常接近,他觉得bench-maxxing不一定是一个贬义词。

垂直领域的小团队,机会在哪

关于数据采购,何允中提到了几块问题。首先,最近兴起的这些RL environment公司,其实更多的是在做合成。因为整个数据行业已经从找人标注,慢慢地过渡到你要交付的是一整套环境,然后这个环境可能需要大量的工程工作在里面。很多在这些合成的技术栈上做得比较好的一个小团队,其实可以比较短的时间……

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
5%税率、最长5年:香港这套组合拳,盯上的是深圳硬科技老板

5%税率、最长5年:香港这套组合拳,盯上的是深圳硬科技老板

风向观察
2026-10-08 15:21:29
2018年福建男子侵犯女子,得逞后返回现场,丈夫在家竟不知情

2018年福建男子侵犯女子,得逞后返回现场,丈夫在家竟不知情

罪案洞察者
2025-02-24 11:33:51
事态升级!下跪空姐获“行业巨头”撑腰,3点声明硬气,欧某傻眼

事态升级!下跪空姐获“行业巨头”撑腰,3点声明硬气,欧某傻眼

孤城落日
2026-10-08 22:19:59
细思极恐!暴力催收消失后,网贷开启司法软暴力收割,杀伤力翻倍

细思极恐!暴力催收消失后,网贷开启司法软暴力收割,杀伤力翻倍

呼呼历史论
2026-10-09 04:14:54
小飞人陈妤颉暂时未达世锦赛标准,世界排名第43,望通过积分入围

小飞人陈妤颉暂时未达世锦赛标准,世界排名第43,望通过积分入围

杨华评论
2026-10-08 21:14:31
2013年金马奖,蔡康永刚说完“这是我家不是你家”,黄渤接梗:“我只看过人骑马,没看过马骑人。”

2013年金马奖,蔡康永刚说完“这是我家不是你家”,黄渤接梗:“我只看过人骑马,没看过马骑人。”

静若梨花
2026-10-08 16:36:05
父亲将智障儿子扔青海戈壁,19年后妈妈去旅游碰见:妈妈,是你吗

父亲将智障儿子扔青海戈壁,19年后妈妈去旅游碰见:妈妈,是你吗

晓悦流年
2025-09-10 15:08:49
江淮汽车再度跌停,两日市值蒸发118亿;懂车帝测试尊界V800主视频在B站、微博等多个平台已无法正常访问,懂车帝网页版也无法查找到该视频

江淮汽车再度跌停,两日市值蒸发118亿;懂车帝测试尊界V800主视频在B站、微博等多个平台已无法正常访问,懂车帝网页版也无法查找到该视频

都市快报橙柿互动
2026-10-09 11:50:08
克什米尔地方官员曾称:若必须选,我们既不想加入印度,也不想加入巴基斯坦,克什米尔民众更倾向于加入中国,其背后是70年难以破解的僵局

克什米尔地方官员曾称:若必须选,我们既不想加入印度,也不想加入巴基斯坦,克什米尔民众更倾向于加入中国,其背后是70年难以破解的僵局

z千年历史老号
2026-10-08 18:31:38
杨兰兰再现“江湖”!英媒再度将目光投向澳洲劳斯莱斯撞车事件的当事人杨兰兰,不少隐秘细节接连被挖掘出来,这名女子的背景着实不一般

杨兰兰再现“江湖”!英媒再度将目光投向澳洲劳斯莱斯撞车事件的当事人杨兰兰,不少隐秘细节接连被挖掘出来,这名女子的背景着实不一般

火山詩话
2026-10-08 07:19:18
0-2落后连扳四局逆转!18岁张本美和时隔55天复仇王艺迪 无愧日乒王牌

0-2落后连扳四局逆转!18岁张本美和时隔55天复仇王艺迪 无愧日乒王牌

颜小白的篮球梦
2026-10-09 14:18:17
懂车帝神补刀,余承东“造车”遭遇“三英战吕布”

懂车帝神补刀,余承东“造车”遭遇“三英战吕布”

量子派
2026-10-09 00:02:10
佐藤瞳:朱思冰进步明显,进攻手段多样,削球大战不擅长也不惧怕

佐藤瞳:朱思冰进步明显,进攻手段多样,削球大战不擅长也不惧怕

排球黄金眼
2026-10-09 11:04:14
143元一瓶破30亿!又一白酒从山姆杀出,搅动2000亿赛道

143元一瓶破30亿!又一白酒从山姆杀出,搅动2000亿赛道

叮当当科技
2026-10-09 05:09:25
曾4次阴阳中国!对决郑钦文前1天 斯维托丽娜去了趟故宫并发了照片

曾4次阴阳中国!对决郑钦文前1天 斯维托丽娜去了趟故宫并发了照片

风过乡
2026-10-09 07:44:20
菲海警在中国海警水炮拦截下,还是完成对仁爱礁破船医疗后送任务

菲海警在中国海警水炮拦截下,还是完成对仁爱礁破船医疗后送任务

三叔的装备空间
2026-10-08 21:33:53
伊朗这一仗打完,中美至少50年内不会开战,理由就三条:其一,美国已经看清了,连被封锁40年的伊朗都拿不下,它拿什么跟中国打?

伊朗这一仗打完,中美至少50年内不会开战,理由就三条:其一,美国已经看清了,连被封锁40年的伊朗都拿不下,它拿什么跟中国打?

扶苏聊历史
2026-10-09 11:50:53
中国多次申请进入CPTPP,CPTPP大门为何难进?

中国多次申请进入CPTPP,CPTPP大门为何难进?

律法刑道
2026-10-09 11:09:10
我和保姆搭伙过26年,临终给她800块给儿子1套房,保姆取钱时愣住

我和保姆搭伙过26年,临终给她800块给儿子1套房,保姆取钱时愣住

温情邮局
2025-09-10 15:09:12
美伊局势,突传重磅!

美伊局势,突传重磅!

证券时报
2026-10-09 08:14:20
2026-10-09 15:28:49
野生运营
野生运营
懂点产品,懂点AI,正在努力给平淡日子搞点新花样。
191文章数 95关注度
往期回顾 全部

财经要闻

央行为何发布关于人民币汇率的政策立场

头条要闻

男子下楼抽烟2分钟 价值3000万港币黄金被换成柔顺剂

头条要闻

男子下楼抽烟2分钟 价值3000万港币黄金被换成柔顺剂

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

蔡康永回应,装都不装了!

科技要闻

字节"干扰模型训练"实习生融资近2亿元

汽车要闻

不想改车又不想撞衫 来看看小鹏P7+的黑武士版

态度原创

健康
旅游
手机
时尚
公开课

痘坑留下后,还能填平吗?

旅游要闻

激活红色资源 河南新县全域文旅多点开花

手机要闻

华为上调nova 16系列部分版本价格:SE涨200元,标准版/Pro涨400元

从夜幕金辉到另类宇宙,巴黎更美了吗?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版