网易首页 > 网易号 > 正文 申请入驻

当“AI饲料”,我都被AI嫌弃了?

0
分享至



2026年9月18日,纽约南区联邦法院解封了一批文件,里面包含了OpenAI和微软的内部记录。

材料显示,OpenAI和微软通过采集别人生产的内容,训练自己的模型。

但这并不是个例,我们在网上记录的点点滴滴,如今正逐渐变成AI的“饲料”。

AI不会给你点赞、收藏或者转发,因为它压根不理解你创作的内容,只是把你留下的一切收进去,变成它自己的一部分。

于是写作、绘画、说话、歌唱、拍照,这些原本属于人的事,忽然变成了AI发展的核心。

但是你也不必太担心,有一个不知道是好是坏的消息,未来AI不会再把我们当成饲料了,因为它马上学会自己造饲料。

01

事件来龙去脉

2026年9月17日,纽约南区联邦法院解封了一批文件。这批文件来自《纽约时报》起诉OpenAI和微软的版权案,内容是两家公司的内部记录。

在一份内部备忘录里,微软应用科学总监布伦特·赫克特(Brent Hecht)把用全网内容训练大模型称为“一场规模前所未有的惊人盗窃”,并说这很可能是“人类历史上最大的一次劳动盗窃”。这句话出自被告公司的员工,不是原告的指控。

这起官司已经打了将近三年。

原告是《纽约时报》,被告是OpenAI和微软。此前庭审的走向总体上支持“用版权内容训练模型属于合理使用”。这批解封材料的不同之处,在于它提供的是被告自己的内部记录,而不是法律论证。

微软的内部测算显示,Copilot上线后,《纽约时报》域名的点击率相比传统Bing搜索最多下降93%。

在内部演示文稿中,赫克特把这种下滑称为“死亡循环”,认为它“会同时伤害我们模型的表现,也会伤害整个互联网”。



他还写道,一个终端产品威胁到自己关键供应商的经济根基,这种情况极不寻常,但这是模型业务和它的“内容供应链”造成的局面。文稿中的“供应商”,指的就是生产内容的新闻媒体。

ChatGPT负责人尼克·特利(Nick Turley)在内部沟通中说,ChatGPT这类产品对出版机构构成“生存威胁”,而且“在很大程度上是替代性的”,“随着它们变得更强,会越来越具有替代性”。

OpenAI总裁布罗克曼说,这些模型“非常擅长新闻”。纳德拉在今年作证时承认,和聊天机器人对话“已经替代了直接去网站获取信息”。

然而法律要求不能“替代或损害原作品的市场”。

文件同时还给出了训练数据的规模。仅OpenAI的训练数据集中,就包含《纽约时报》《每日新闻》和调查报道中心的作品91692份拷贝。

在一个从Common Crawl派生的数据集中,仅nytimes.com一个域名就抓取了两百多万份文档。不过其他媒体表示,从《纽约时报》抓取390万份,从《芝加哥论坛》报及其相关报刊抓取730万份。

此外还有一个名为Project Mango的项目,其数据集包含至少160903部新闻出版方的独立作品。OpenAI把整个GPT-3训练数据集交给了微软,微软则通过Project Taxi和Project Mango把数据回输给OpenAI。

文件中还记录了具体操作方式。

OpenAI研究员尼克·赖德(Nick Ryder)告诉布罗克曼,自己有一个“绕过纽约时报付费墙的黑客方法”,布罗克曼回复“不错”。

两人搭建的数据集WebText、WebText2,有相当大一部分是从网上直接抓来的新闻报道。还从Common Crawl拉取了数百万篇文章。

此外,在数据进入模型前,他们会刻意删除版权声明,因为研究人员“不想让模型向用户输出‘版权声明’”。

原告代理律师史蒂文·利伯曼(Steven Lieberman)说,证据表明,OpenAI和微软知道自己在做的事是错的。

微软对这批文件回应称,相关言论只是反映了一名员工的个人观点,不是法律分析,更不代表公司立场。赫克特并非决策者,公司雇他是为了“呈现不同的、非对称的视角”。

02

还有谁在喂 AI?

实际上OpenAI已经是“二进宫”了。

2023年9月,美国作家协会连同17位作家,如约翰·格里森姆(John Grisham)、乔治·R·R·马丁(George R. R. Martin)、朱迪·皮考特(Jodi Picoult)、大卫·鲍尔达奇(David Baldacci)、乔纳森·弗兰岑(Jonathan Franzen)、斯科特·图罗(Scott Turow)等人。

在纽约南区对OpenAI提起集体诉讼。此后,多起作家诉讼(特伦布莱(Tremblay)、西尔弗曼(Silverman)、夏邦(Chabon)等)陆续并入,原告规模还在扩大。

《纽约时报》诉状里的证物J,标题叫《GPT-4 记忆〈纽约时报〉内容的一百个例子》,整整 127 页。喂给它一篇文章的开头,它能几乎逐字补完剩下的部分,连署名和引语都在。

2026 年,arXiv上发布了一篇名为《对齐打地鼠》的论文。

研究者把模型微调成“按情节写全文”——只给情节摘要,不给原文。结果GPT-4o、Gemini 2.5 Pro能复现出85%到90%的版权书籍原文,单段逐字复现超过460个词。研究者给这种现象起了个名字,叫“对齐打地鼠”:你堵住一个漏洞,它在别处又冒出来。

这不是偶然。尼古拉斯·卡尔利尼(Nicholas Carlini)早在 2023 年就说过:模型越大、你那段数据被重复喂的次数越多、上下文给得越足,它记得就越死。



实际上扒取网上的公开资料,把人们的记录变成AI饲料的,远不止于OpenAI和微软。

2026年9月4日,一起集体诉讼递到了伊利诺伊北区联邦法院。原告是两个家庭,连同他们的孩子。诉状指控 Meta 未经同意,抓取Facebook和Instagram用户的照片和生物特征数据,用来训练三样东西:人脸识别系统NameTag 背后的模型、给NameTag做比对用的“人脸指纹”,以及生成式图像模型Emu和Muse Image。

NameTag是给Ray-Ban和Oakley智能眼镜准备的。早在2026年6月初,就有人发现在Meta的配套App里存在NageTag相关的代码,只不过当时并不知道这个功能是干什么用的。

Meta的回应是:“这起诉讼没有依据,曲解了我们的工作……NameTag没有向消费者发布,也没有最终决定要做什么。”它还强调,自己“不是在建立一个通用的人脸数据库”。

话虽如此,但Meta已经是第三次因为人脸识别被告上法庭了。

2021 年,它因为“自动标记好友”违反伊利诺伊《生物识别信息隐私法》,赔了6.5亿美元,约142万伊利诺伊用户分钱,有人拿到了400多美元。2023年,Instagram的人脸识别又让它赔了6850万美元,约400万伊利诺伊居民符合资格。Snap也因类似问题在2016年赔了3500万美元。

这部法律的罚则是每人每项1000到5000美元。

从金额来看,以Meta的用户规模,Meta可能要赔付超过10亿美元。不过Meta仍然选择付钱,毕竟相对于赔偿而言,法庭并没有阻止Meta继续开发模型,因此赔偿仍在可接受的范围内。

Meta的采集对象,也不只是用户。

2026年4月21日,Meta在美国员工的工作电脑上安装一款追踪软件,实时记录鼠标移动、点击位置和键盘输入,并定期截屏,用来训练它的AI模型。

这款工具叫“模型能力计划”(Model Capability Initiative)。Meta首席技术官安德鲁·博斯沃思(Andrew Bosworth)在内部备忘录中说,长期目标是把 AI 智能体培养成“承担工作”的角色,人类员工则转为“指挥、审查和协助改进”。

这个项目后来改名为“Agent转型加速器”。Meta的发言人称,这些数据只用于训练模型,不用于绩效考核,并设有保护敏感内容的措施。

但据媒体报道,采集范围覆盖员工日常使用的各类应用和网站,包括谷歌、GitHub、Slack,甚至个人Gmail;美国员工无法退出,只有受欧盟《通用数据保护条例》约束的欧洲员工被排除在外。

同一周,Meta裁掉约8000名员工,不少员工因此担心,自己正在亲手训练将来取代自己的AI。到2026年6月,Meta暂停了这项计划,原因是追踪工具抓取到了敏感信息,且这些信息一度被全公司访问。

Meta的手,也不只伸向自家平台。

Meta专门有个用来扒视频内容的爬虫,名为MSAE。Meta AI自己承认,训练数据里有370万条YouTube视频转录文本的第三方数据集。

2026年1月,包括h3h3 Productions、Mr. ShortGame Golf、Golfholics在内的几位YouTube博主,合计620万订阅,在加州中区联邦法院起诉Snap,指控它用后端自动化工具,把数百万条YouTube视频的视听文件成批下载下来,塞进HD-VILA-100M和Panda-70M数据集,用来训练“Imagine Lens”这类的图像编辑能力。

诉状没有走传统版权路线,而是主攻《数字千年版权法》第1201条的反规避:YouTube的设计是让人在线观看,不是让人拿到原始文件,Snap涉嫌在规模化层面,违反了该法律法规。

原告之一伊桑·克莱因(Ethan Klein)还顺手把英伟达、Meta、字节跳动、亚马逊、OpenAI、苹果一并告了。他的说法是,这些公司“一天能抓走80年的内容”。

搜索是谷歌的核心业务,因此谷歌也在名单上。

2026年7月,阿歇特出版集团、Cengage、爱思唯尔,连同畅销书作家斯科特·图罗,在纽约把谷歌告了,指控它用数百万本版权书籍训练Gemini。诉状称,谷歌从“已知的盗版来源”抓内容,甚至绕过学术网站的付费墙,去拿爱思唯尔旗下《柳叶刀》、《细胞》的文章。

诉状称:Gemini可以在20分钟内,用0.39美元,生成一部10万字的悬疑小说。谷歌内部文件也警告过,这么做可能“给谷歌带来100亿到1000亿美元的潜在罚款”。

语音和音乐,也没能幸免。

苹果的Siri,把“意外唤醒”时的录音交给外包合同工去听。据外媒报道,里面充斥着医生和病人的对话、商业谈判、疑似犯罪交易。有评估员一天要听多达1000条。苹果最终以9500万美元和解。

2024年6月,RIAA代表环球、索尼、华纳,把AI音乐公司Suno和Udio告了,指控它们用受版权保护的录音。

03

最后一批饲料

不过我们也不需要担心什么,因为我们即将成为AI的最后一批饲料。如今,AI公司,已经开始自己喂自己了。

2026年6月,Anthropic发了一篇博客,标题叫《当AI建造自己》。里面提到,截至2026年5月,合并进Anthropic生产代码库的代码,超过80%是Claude写的,不是人写的。在那之前,这个比例还只是个位数。

也就是说,15个月里,这家公司把绝大部分编程工作交了出去。有工程师已经五个月没写过一行代码;他们每天合并的代码量,是几年前的8倍。

2026年9月17日,Anthropic又发布了一份报告,标题是《衡量AI发展的速度》,这篇文章主要讲的是“研发工作有多少由AI主导”。它采用Epoch AI提出的自动化等级,从完全没有AI参与的AL0,到AI完全自主的AL5来划分。

其中AL4指AI能从一句大致的目标出发,端到端完成大部分工作,人类只负责监督和最后决策。

文章提到,2026年2月,Anthropic达到AL4这一级别的研发工作还不到1%。5月是12%,7月是22%,8月已经升到26%。

如果把标准放宽到“AI在人的密切指导下完成大块工作”的AL3,则有超过90%的研发工作达标。报告还提到Anthropic内部最主要的Agent平台上,任意时刻约有3万个AI Agent在从事研究和工程工作,仅在2026年8月就产生了超过10亿次决策。



OpenAI那边,走的是另一条路。

2026年7月,OpenAI披露,发布GPT-5.6时,它用最强的Sol模型,去自主“后训练”了一个更小的模型Luna。研究员只给了一句“相当不充分的提示”,Sol就自己找训练配置、挑GPU、启动训练脚本、验证运行,还顺带生成了合成训练数据。

这项工作,过去要两个资深研究员做两周。在OpenAI内部的“递归自我改进指数”上,Sol比上一代GPT-5.5高出16.2分。

Anthropic把这件事叫递归自我改进。它的本质,是训练数据的来源,正在从“人类生产的内容”,切换成“AI 自己生成的内容”。

而你,就是这次切换完成之前的,最后一茬人类饲料。

问题是,AI 自己生成的数据,撑得起下一波模型吗?

2024年,舒马伊洛夫(Shumailov)等人在《自然》上发了一篇论文,标题为《AI模型在递归生成数据上训练时会崩溃》。

他们发现,如果反复用合成数据训练模型,模型会“坍缩”,输出的多样性不断收窄,尾部信息被系统性抹掉,最后变成一种“语法正确、但语义空洞”的状态。

论文的结论是,你不能用合成数据完全替代人类数据,必须两者叠加。只要原始的人类信号还在,模型就还健康。

所以现在行业的配方,大概是10%到30%的真实人类数据打底,剩下的靠模型自己喂自己。

那10%到30%,就是我们还剩的用处。但很可惜,连这个用处也在倒计时。

一旦合成数据的质量足够稳定,一旦这个闭环转得够顺,人类数据就再也没有采集的必要。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
苹果三款新品突然官宣:10月13日,正式发布

苹果三款新品突然官宣:10月13日,正式发布

科技堡垒
2026-10-01 09:16:52
王曼昱也没料到,明明自己在亚运会夺冠,却让陈梦再次“火出圈”

王曼昱也没料到,明明自己在亚运会夺冠,却让陈梦再次“火出圈”

调侃国际观点
2026-09-30 16:12:55
家财再多又如何,刘欢离世后妻子现状,给所有原配夫妻敲醒警钟

家财再多又如何,刘欢离世后妻子现状,给所有原配夫妻敲醒警钟

老娱记啊
2026-09-30 14:42:40
猕猴桃大量上市!发现:糖尿病吃一次猕猴桃,等于给血糖添堵?

猕猴桃大量上市!发现:糖尿病吃一次猕猴桃,等于给血糖添堵?

路医生健康科普
2026-09-25 15:45:03
心理学中,有个永不抑郁的秘诀

心理学中,有个永不抑郁的秘诀

鼠鼠健康图鉴
2026-09-30 06:00:13
血栓一旦形成,耳朵先知?医生:血栓患者,耳朵一般有这4个表现

血栓一旦形成,耳朵先知?医生:血栓患者,耳朵一般有这4个表现

健康之光
2026-09-30 20:15:10
网友吐槽,麦当劳都快变成垃圾场了,中途没人收拾,吃完也没人收拾,到底因为啥?

网友吐槽,麦当劳都快变成垃圾场了,中途没人收拾,吃完也没人收拾,到底因为啥?

眼光很亮
2026-09-29 12:56:10
撕了18个月烧掉6000万后,她开掉了合作20年的公关

撕了18个月烧掉6000万后,她开掉了合作20年的公关

浅遇时光
2026-09-30 00:46:08
国内将逐渐停止“肠息肉手术”?做完人就废了?医生讲出实情

国内将逐渐停止“肠息肉手术”?做完人就废了?医生讲出实情

叙说医疗健康
2026-10-01 09:00:47
巨亏近100亿,高瓴割肉跑了

巨亏近100亿,高瓴割肉跑了

投资家
2026-09-01 20:45:25
"我不认识何炅杨迪!"刘学义一句话上热搜,内娱i人天花板实锤

"我不认识何炅杨迪!"刘学义一句话上热搜,内娱i人天花板实锤

娱乐追光侠
2026-09-30 13:15:10
50分钟卡死变秒破,PS5全版本告破

50分钟卡死变秒破,PS5全版本告破

野生运营
2026-09-30 23:50:38
大陆收台美国怎么选,美军上将用一句中国古话,给所有人交了底

大陆收台美国怎么选,美军上将用一句中国古话,给所有人交了底

南风不及你温柔
2026-09-30 17:13:35
戴帽子会引发脑梗?医生含泪劝告:60岁以后,这5件事一定要盯紧

戴帽子会引发脑梗?医生含泪劝告:60岁以后,这5件事一定要盯紧

路医生健康科普
2026-10-01 10:30:06
《街霸》电影春丽演员苦练大腿!每天狂吃12个鸡蛋

《街霸》电影春丽演员苦练大腿!每天狂吃12个鸡蛋

3DM游戏
2026-08-29 11:32:21
中国球迷意难平!不止因为国足1:2遭韩国逆转,更多在于这五点!

中国球迷意难平!不止因为国足1:2遭韩国逆转,更多在于这五点!

田先生篮球
2026-09-30 16:48:08
昔日国乒名将陈龙灿发声!张本宇留日另有原因,当年选择不简单

昔日国乒名将陈龙灿发声!张本宇留日另有原因,当年选择不简单

潋滟晴方DAY
2026-08-13 13:06:45
黄仁勋与李在镕同框,承诺英伟达将延续与三星电子长达33年的合作

黄仁勋与李在镕同框,承诺英伟达将延续与三星电子长达33年的合作

IT之家
2026-09-30 20:37:08
田永明今天被执行死刑 强奸大嫂出狱后又杀人

田永明今天被执行死刑 强奸大嫂出狱后又杀人

看看新闻Knews
2026-04-28 15:44:15
后梅西首战4-0!阿根廷为何赢得如此轻松?斯卡洛尼点评一针见血

后梅西首战4-0!阿根廷为何赢得如此轻松?斯卡洛尼点评一针见血

晚雾空青
2026-10-01 13:52:00
2026-10-01 15:48:49
字母榜 incentive-icons
字母榜
让未来不止于大。
2821文章数 8094关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

鲁比奥要求伊朗代表团立即离境 伊外长凌晨登上飞机

头条要闻

鲁比奥要求伊朗代表团立即离境 伊外长凌晨登上飞机

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

教育
手机
亲子
家居
公开课

教育要闻

成功入选!十一系这所学校,表现亮了!

手机要闻

HMD Vibe2 Pro手机发布:6.78英寸1080P LCD屏幕,天玑6300芯片

亲子要闻

宝爸宝妈看过来!国庆如何带娃安稳度假?专家建议孩子假期作息可以比上学时稍宽松

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版