OpenAI的模型训练数据从哪来?财经时报一份独家报告给出了一个具体数字:55个网站。这个名单里,出现了美国政府机构的身影。
马库斯在社交平台上引用了这份报告。他点出的关键信息很直接——被抓取数据的网站中,包括CDC(美国疾病控制与预防中心)和SEC(美国证券交易委员会)这样的政府实体。
![]()
名单里的政府机构意味着什么
CDC和SEC不是普通的内容站点。一个是公共卫生领域的权威机构,一个是金融监管的核心部门。它们的网站承载的是公共信息与监管文件。
马库斯把这条信息拎出来,落点不在"抓了多少",而在"抓了谁"。55个网站这个数字本身是规模问题,名单里出现政府机构,性质就变了。
马库斯为什么盯这件事
马库斯长期关注AI安全与伦理议题。他引用这份报告时,没有展开长篇分析,只把事实摆出来:来源是财经时报的独家报道,抓取范围覆盖55个网站,政府机构在列。
这种处理方式本身就是一种表态。数据来源的边界在哪里,训练语料的获取是否经过授权,这些问题随着名单曝光被推到台前。
目前披露的信息停留在"抓取了哪些网站"这一层。至于抓取的具体内容、规模、用途,报告之外没有更多细节。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.