![]()
成立约 18 个月后,AfterQuery 成了 Y Combinator 历史上成长最快的独角兽。
据《福布斯》援引两位直接知情人士报道,这家人工智能训练数据公司正在筹集新一轮融资,估值达到 32 亿美元。公司已经确定领投方,但融资金额和投资者身份尚未披露,AfterQuery 也拒绝置评。YC 合伙人 Gustaf Alströmer 称,如果交易按当前条件完成,它将刷新 YC 公司从成立到进入独角兽行列的速度纪录。
5 个月前,AfterQuery 刚刚完成由 Altos Ventures 领投的 3,000 万美元 A 轮融资,投后估值为 3 亿美元。新一轮估值相当于上涨超过 10 倍。
AI 训练数据这条赛道早已造就过一批年轻创始人的融资奇迹。Scale AI 创始人 Alexandr Wang 在 24 岁时成为亿万富翁;Mercor 的三位创始人也在 22 岁时凭借百亿美元估值跻身亿万富翁行列。如今,AfterQuery 又以更快的速度复制了这条路径。
那么问题来了,在训练数据这个听起来早已不再新鲜和“性感”,而且又塞满多家高估值公司的赛道,为什么仍能容纳新的独角兽?
实际上,AfterQuery 最初并不准备销售训练数据。
2025 年初,AfterQuery 创始人 Mateega 与他的高中好友 Carlos Georgescu 进入 YC 冬季项目时,计划开发用于金融工作的 AI 智能体。在测试中,他们发现,当时的模型能够生成看似完整的答案,却经常无法处理真实金融工作中的假设、例外情况和判断取舍。
![]()
图丨 AfterQuery 团队(来源:AfterQuery)
于是,团队最终放弃应用层产品,转而收集模型缺失的训练材料:金融分析师如何建立假设,律师如何修改合同,医生如何排除诊断,软件工程师如何在现有代码中修复问题。
AfterQuery 将这些过程加工成监督微调数据、评测集、评分规则和强化学习环境。与传统标注任务相比,专家交付的不只是一个正确答案,还包括操作顺序、决策依据、工具使用和错误修正。
公司称,其专家网络已有近 10 万名从业者,覆盖金融、法律、医疗和软件工程等领域。公开客户包括 Nvidia、法律 AI 公司 Legora,以及 Mira Murati 创立的 Thinking Machines Lab;部分数据还被用于 Nvidia 的 Nemotron 模型。上述客户关系和专家规模主要来自公司披露。
这种“把专业判断编码成数据”的表述并不新鲜。AfterQuery 的速度很快,但它进入的是一条已经出现多家高估值公司的赛道。
最为大众所熟知的 Scale AI 最初依靠大量外包人员标注图片和其他基础数据起家。随着大模型发展,它逐渐把业务扩展到专家数据、模型评测和后训练。2024 年,Scale AI 完成 10 亿美元融资,估值达到 138 亿美元;2025 年 Meta 投资 143 亿美元时,其对应估值超过 290 亿美元。
Mercor 则更直接地把专业人士组织成训练数据供应网络。它招募医生、律师、程序员、银行从业者和研究人员,为模型公司设计任务、回答问题并评价结果。Mercor 在 2025 年以 100 亿美元估值融资,2026 年又传出按 200 亿美元估值筹集约 5 亿美元的计划。
所以说,Scale AI 和 Mercor 的高估值说明,资本很早就认识到专业人类数据的价值。AfterQuery 的机会并不是来自一个无人发现的市场,而是来自模型训练目标的移动。
早期数据标注主要告诉模型一张图片里有什么,或者哪段回答更好。推理模型和智能体需要掌握更长的任务链:打开哪些软件,读取哪些文件,遇到冲突信息如何取舍,执行失败后如何恢复,以及怎样判断任务是否真正完成。
Scale AI 今年 2 月称,其接近一半的新数据训练项目已经涉及强化学习环境。环境会复刻软件和业务状态,记录智能体的每一步行动,再用专家设计的验证器检查实际结果,而不只判断最后生成的文字是否合理。
低成本标注没有消失,高价专家数据也存在多年。2026 年的新趋势,是两者之外又出现了一类商品:真实企业积累下来的工作轨迹。
据报道,AfterQuery 已经收购约 30—50 家倒闭创业公司的代码库,Turing 收购了约 5—10 家。AfterQuery 会把真实代码改造成训练任务:让模型尝试增加功能或修复问题,再将工程师曾经提交的代码作为参照,生成可用于后训练的数据。
Turing 则推出了“Project Lazarus”,公开收购私有代码库及其配套资料。它给出的价格表中,遗留代码库价值通常为 1 万至 10 万美元以上,现代代码库最高约 1 万美元;Jira 工单、产品需求文档、架构资料和客服记录也可以按件计价。
在这些数据背后,真正有价值的并非某一段代码,而是代码形成的过程。一套投入实际使用的产品会留下需求变更、设计争论、故障记录、用户投诉和补丁。它们共同说明一家公司如何在成本、时间、安全和客户要求之间作出选择。这类资料很少出现在开源项目或公开网页中,也很难用合成数据完整复刻。
Spirit Airlines 这家公司的破产拍卖让这场争夺进入了更公开的阶段。Google 曾以 1,000 万美元竞得 Spirit 的内部数据,超过 Mercor 的 750 万美元报价;AI 数据公司 Micro1 随后又提交了 1,250 万美元的逾期报价。待售资料包括约 1 亿封邮件、5 亿条 Teams 消息、3,000 万行代码,以及可追溯到 1986 年的部分员工记录。截至 9 月 2 日,交易仍需等待破产法院裁决,Google 获得的是竞价优势,还没有正式取得数据。
这类交易再次推宽了专家数据的边界。知识不只存在于某位律师或工程师脑中,也存在于一家公司多年积累的邮件、工单、代码修改和协作关系里。公开互联网保存了大量最终成果,却很少记录成果产生前的犹豫、返工和妥协。企业内部档案所保存的,恰好是模型最难从公开语料中学到的部分。
与此同时,数据越接近真实工作,其隐私和安全风险越难处理。Mercor 今年遭遇数据泄露后,Meta 暂停了与其合作,OpenAI 也对事件展开调查。泄露内容可能涉及模型公司的训练方法、承包人员信息和专有数据。
Spirit 的资料计划在交付前去除身份信息,但员工关系和跨系统记录需要保留,否则数据就会失去训练价值。美国空乘人员协会据此提出异议:当邮件、聊天和文件仍然可以沿着同一名员工的行为轨迹串联,重新识别个人的风险并不会完全消失。
员工在工作中产生的数据由谁拥有,公司倒闭后谁有权出售,匿名化能否覆盖商业秘密和个人关系,这些问题尚未形成稳定答案。数据公司越接近真实工作,获得的训练信号越有价值,需要承担的隐私和知识产权风险也越集中。
32 亿美元的估值再次说明,投资人并不认为数据服务会随着大模型变得更聪明而迅速贬值。模型能力每向真实工作推进一步,训练数据也要跟着从答案进入过程,从公开语料进入企业内部,从一个专家的判断进入一整套组织运行记录。
参考资料:
1.https://www.forbes.com/sites/annatong/2026/09/01/afterquery-becomes-ycs-fastest-unicorn-at-32-billion/
2.https://scale.com/blog/rl-environments
3.https://www.turing.com/blog/agi-advance-newsletter-57
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.