网易首页 > 网易号 > 正文 申请入驻

数亿美元!传英伟达已收购合成数据公司Gretel

0
分享至


智东西
作者 ZeR0
编辑 漠影

智东西3月20日消息,据《连线》报道,两位了解该交易的人士透露,英伟达已以九位数收购了合成数据公司Gretel。

消息人士称,此次收购价格超过了Gretel最新的3.2亿美元(约合人民币23亿元)估值,不过具体的收购条款尚不清楚。Gretel及其约80名员工的团队将被并入英伟达,其技术将作为英伟达生成式AI服务套件的一部分。

此次收购正值英伟达推出合成数据生成工具之际,开发人员可以训练自己的AI模型并针对特定应用进行微调。理论上,合成数据可以创造近乎无限的AI训练数据供应,并帮助解决自2022年ChatGPT成为主流以来一直困扰AI行业的数据稀缺问题。尽管专家表示,在生成式AI中使用合成数据有其自身的风险。

英伟达、Gretel发言人拒绝发表评论。

一、交易将补强英伟达合成数据布局

Gretel成立于2019年,创始人包括Alex Watson、John Myers、Ali Golshan,Golshan担任首席执行官。这家初创公司为想要构建生成式AI模型但无法获得足够训练数据或对使用真实数据存在隐私担忧的开发人员提供合成数据平台和一套API。

Gretel不会构建和授权自己的前沿AI模型,而是对现有的开源模型进行微调以添加差异隐私和安全功能,然后将它们打包在一起出售。Pitchbook显示,该公司在被收购前筹集了超过6700万美元的风险投资资金。

与人类生成的数据或现实世界数据不同,合成数据是由计算机生成的,旨在模仿现实世界的数据。支持者认为,这使得构建AI模型所需的数据生成更具可扩展性、劳动强度更低,并且更易于规模较小或资源较少的AI开发人员使用。

隐私保护是合成数据的另一个关键卖点,使其成为医疗健康提供商、银行和政府机构的有吸引力的选择。

多年来,英伟达一直在为开发人员提供合成数据工具。2022年,该公司推出了Omniverse Replicator,让开发人员能够生成自定义的、物理上准确的合成3D数据来训练神经网络。

去年6月,英伟达开始推出一系列开放式AI模型,这些模型可生成合成训练数据,供开发人员用于构建或微调大语言模型。这些迷你模型被称为Nemotron-4 340B,开发人员可以使用它们为自己的大语言模型收集合成数据,涉及“医疗保健、金融、制造、零售和其他所有行业”。

二、合成数据能补充数据集,增强隐私保护

在昨日主题演讲中,英伟达创始人兼CEO黄仁勋谈到行业在以经济高效的方式快速扩展AI方面所面临的挑战。

“我们重点关注三个问题,”他说。“第一,如何解决数据问题?如何以及在哪里创建训练AI所需的数据?第二,模型架构是什么?第三,Scaling Laws是什么?”黄仁勋继续描述了该公司目前如何在其机器人平台上使用合成数据生成。

瑞士洛桑联邦理工学院研究合成数据隐私的博士后研究员Ana-Maria Cretu说,合成数据至少能以几种不同的方式使用。它可以采用表格数据的形式,例如人口统计或医疗数据,这可以解决数据稀缺问题或创建更多样化的数据集。

Cretu举了一个例子:如果一家医院想要建立一个AI模型来追踪某种类型的癌症,但正在处理的数据集只有1000名患者,那么可以使用合成数据来填充数据集,消除偏见,并匿名化真实人类的数据。

“这还可以提供一些隐私保护,因为您不能向利益相关者或软件合作伙伴披露真实数据。”Cretu说。

但Cretu补充说,在大语言模型领域,合成数据也已成为“我们如何才能随着时间的推移增加大语言模型的数据量?”的一个无所不包的阶段。

三、重复训练可能导致质量显著下降

专家们担心,在不久的将来,AI公司将无法像以前一样自由地获取人类创造的互联网数据来训练他们的AI模型。去年,麻省理工学院数据来源计划的一份报告显示,对开放网络内容的限制正在增加。

理论上,合成数据可以提供一个简单的解决方案。但2024年7月《自然》杂志上的一篇文章强调,当AI语言模型用其他模型生成的数据反复微调时,它们可能会“崩溃”,即质量显著下降。

换句话说,如果你只给机器喂它自己生成的输出,理论上它就会开始自食其力,结果吐出残渣。

AI数据标注公司Scale AI的首席执行官Alexandr Wang分享了《自然》杂志关于X的文章中的发现,他写道:“虽然当今许多研究人员将合成数据视为AI的哲学之石,但天下没有免费的午餐。” 他在后来的发帖中称,这就是他坚信混合数据方法的原因。

Gretel的一位联合创始人反驳了《自然》杂志的这篇论文,他在一篇博客文章中指出,对纯合成数据进行重复训练的“极端场景”并不代表“现实世界的AI开发实践”。

认知科学家兼研究员加里·马库斯(Gary Marcus)大声批评AI炒作,他当时同意Alexandr Wang的“诊断,但不同意他的处方”。他认为,通过开发新的AI模型架构,而不是专注于数据集的特性,该行业将向前发展。

在给《连线》杂志的一封电子邮件中,马库斯谈道,“像(OpenAI的)o1/o3这样的系统似乎在编码和数学等领域表现更好,因为在这些领域,你可以生成和验证大量合成数据。在开放式领域的通用推理方面,它们效率较低。”

Cretu认为,围绕模型崩溃的科学理论是合理的。但她指出,大多数研究人员和计算机科学家都在使用合成数据和真实数据进行训练。“通过在每一轮新训练中使用新数据,你或许能够避免模型崩溃。”她说。

结语:大模型龙头和科技巨头已积极转向合成数据

对模型崩溃的担忧,并没有阻止AI行业加入合成数据潮流,即便他们这样做时非常谨慎。

据报道,在最近的摩根士丹利技术会议上,OpenAI联合创始人兼首席执行官Sam Altman吹捧OpenAI使用现有AI模型创建更多数据的能力。

Anthropic首席执行官Dario Amodei相信可能可以构建“一个无限的数据生成引擎”,通过在训练过程中注入少量新信息来保持其质量。

大型科技公司也开始转向合成数据。

Meta谈到了如何使用合成数据训练其最先进的大语言模型Llama 3,其中一些合成数据来自Meta的上一个模型Llama 2。

亚马逊云科技的Amazon Bedrock平台允许开发人员使用Anthropic Claude来生成合成数据。

微软Phi-3小型语言模型部分是在合成数据上进行训练的,该公司警告称,“预训练过的大语言模型生成的合成数据有时会降低准确性并增加下游任务的偏差。”

谷歌DeepMind也一直在使用合成数据,但这再次凸显了开发用于生成和维护真正私密的合成数据的管道的复杂性。

“我们知道所有大型科技公司都在研究合成数据的某些方面,”音乐授权初创公司Rightsify的创始人Alex Bestall说,该公司还负责生成AI音乐并将其目录授权给AI模型。“但在我们的交易中,人类数据通常是合同要求。他们可能想要一个60%由人类生成、40%由合成的数据集。”

来源:《连线》

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
清明将至,俗话说:“坟头三不动,一动穷三代”今年应如何祭祖?

清明将至,俗话说:“坟头三不动,一动穷三代”今年应如何祭祖?

磊子讲史
2026-03-20 16:07:07
燃气调价通知

燃气调价通知

孝感汇
2026-03-25 16:38:10
小毛打酱油 浙江双煞快废了!于金永该让位姚浩洋 依木兰眼神太狠

小毛打酱油 浙江双煞快废了!于金永该让位姚浩洋 依木兰眼神太狠

刀锋体育
2026-03-26 10:43:52
态度180度大转变!外媒集体改口:中国已在三大关键领域强势崛起

态度180度大转变!外媒集体改口:中国已在三大关键领域强势崛起

大卫聊科技
2026-03-26 13:11:34
昨天杭州有医院门诊突然多了不少“跑友”,主动要求检查心脏功能!医生:长期跑步不等于心肺功能没问题

昨天杭州有医院门诊突然多了不少“跑友”,主动要求检查心脏功能!医生:长期跑步不等于心肺功能没问题

都市快报橙柿互动
2026-03-26 08:00:05
江西女硕士失踪,被发现时已在教授实验室待6年,魔鬼真的存在

江西女硕士失踪,被发现时已在教授实验室待6年,魔鬼真的存在

灿烂夏天
2025-02-10 20:20:13
巴拿马接手港口仅一个月,中远海运集运宣布恢复中东六国新订舱业务!

巴拿马接手港口仅一个月,中远海运集运宣布恢复中东六国新订舱业务!

趣味萌宠的日常
2026-03-26 14:04:01
美军全球调兵、要打地面战争?伊朗:要给特朗普一个“巨大惊喜”

美军全球调兵、要打地面战争?伊朗:要给特朗普一个“巨大惊喜”

野史日记
2026-03-25 10:00:12
四川高县村支书暴打残疾村妇致轻伤 法院判决免于刑事处罚引争议

四川高县村支书暴打残疾村妇致轻伤 法院判决免于刑事处罚引争议

律法刑道
2026-03-26 10:55:03
女娲的传说藏了一个远古秘密,虽然后人不愿承认,但的确真实存在

女娲的传说藏了一个远古秘密,虽然后人不愿承认,但的确真实存在

铭记历史呀
2026-03-25 13:00:36
英国上将揭露:1997年香港回归真相,谁敢抗衡中国解放军?

英国上将揭露:1997年香港回归真相,谁敢抗衡中国解放军?

老范谈史
2026-03-18 23:51:08
稳居西部第二!马刺三大年轻核心,已成联盟无解难题!

稳居西部第二!马刺三大年轻核心,已成联盟无解难题!

田先生篮球
2026-03-26 14:23:29
逃亡沙特不久,马步芳强取亲侄女为妻,蒋介石:他让我颜面尽失

逃亡沙特不久,马步芳强取亲侄女为妻,蒋介石:他让我颜面尽失

史笔似尘钩
2026-03-17 20:35:07
世预赛欧洲区开打!明晨将有8队出局 8队进决赛 意大利生死战

世预赛欧洲区开打!明晨将有8队出局 8队进决赛 意大利生死战

叶青足球世界
2026-03-26 08:47:10
“我的部长同学进去了”

“我的部长同学进去了”

霹雳炮
2026-03-21 16:58:17
1955年蒋介石想吃奉化老家的黄花泥螺,保密局知道后如何搞到的?

1955年蒋介石想吃奉化老家的黄花泥螺,保密局知道后如何搞到的?

铜臭的历史味
2026-03-16 13:05:54
广东男篮最新动态!杜峰回怼记者发言引不满,胡明轩被批不配顶薪,徐杰状态回归

广东男篮最新动态!杜峰回怼记者发言引不满,胡明轩被批不配顶薪,徐杰状态回归

凯丰侃球
2026-03-26 11:20:03
最早发现伟人才华的3人是谁?其中一人:想救国,必重用毛泽东

最早发现伟人才华的3人是谁?其中一人:想救国,必重用毛泽东

那年的春夏
2024-11-15 22:43:54
特朗普:对伊朗打击未获国会授权,仅为军事行动,不是战争

特朗普:对伊朗打击未获国会授权,仅为军事行动,不是战争

观世环球
2026-03-26 12:50:25
先被里瓦尔多全面逆袭,后遭齐达内强势碾压,全能战士时运不济

先被里瓦尔多全面逆袭,后遭齐达内强势碾压,全能战士时运不济

足篮大世界
2026-03-26 10:52:09
2026-03-26 15:20:49
智东西 incentive-icons
智东西
聚焦智能变革,服务产业升级。
11433文章数 117015关注度
往期回顾 全部

科技要闻

Meta高管狂分百亿期权,700名员工却下岗

头条要闻

担心特朗普突然停战 以总理下令48小时尽力摧毁伊设施

头条要闻

担心特朗普突然停战 以总理下令48小时尽力摧毁伊设施

体育要闻

35岁替补门将,凭什么入选英格兰队?

娱乐要闻

张雪峰家人首发声 不设追思会丧事从简

财经要闻

黄仁勋:芯片公司的时代已经结束了

汽车要闻

一汽奥迪A6L e-tron开启预售 CLTC最大续航815km

态度原创

教育
亲子
数码
时尚
军事航空

教育要闻

高考地理中的花海经济

亲子要闻

躺平的孩子意外觉醒了,在父母学会当“乌龟”!

数码要闻

配件制造商清单泄露:2026款iPad将搭载A18芯片

2026年了,最好看的还是“这件针织”!

军事要闻

担心特朗普突然停战 以总理下令48小时尽力摧毁伊设施

无障碍浏览 进入关怀版