![]()
作者 | 山竹
出品 | 锌产业
一家已经停止运营的航空公司,还能给谷歌留下什么?
答案不是飞机、航线或机场时刻,而是大约1亿封内部邮件、5亿条Microsoft Teams消息、数千万份企业文件,以及一套记录了公司如何决策、协作和运转的数据系统。
美国纽约南区破产法院文件显示,谷歌在8月14日举行的破产资产拍卖中,以1000万美元成为Spirit Airlines“去标识化数据”的最高竞标者。
另一家竞标者是AI数据公司Mercor,报价750万美元。
不过,该笔交易还需获得破产法院批准。
谷歌对媒体表示,这批企业数据可以用于改进其产品和AI模型,交付前将由第三方清除其中的个人身份信息。
从金额上看,1000万美元对于谷歌只是一笔小交易,但它透露出的信号并不小:
当公开互联网语料逐渐触及版权、质量和稀缺性的边界,AI公司正在把目光转向过去很少被单独定价的资产——一家真实企业留下的“工作记忆”。
01 买下的,不只是一批邮件
Spirit Airlines出售的并非乘客名单,也不只是一个容量庞大的电子邮箱备份。
法院披露的资产清单显示,谷歌拟获得的数据包括约1亿封邮件、8万个邮件账户、5亿条Teams消息、约1708万份OneDrive文件和2058万份SharePoint文件。
此外,还有财务模型、预算材料、供应商信息、项目管理文档、营销数据、航空运营记录、收益管理数据、飞机维修与燃油数据等。
代码同样是交易的重要组成部分,Spirit拟出售516个网页、移动端和后端代码仓库,总计约3000万行代码;
与之配套的还有超过4.3万条代码合并请求、约37万条提交历史、问题讨论、测试结果和持续集成日志。
![]()
换句话说,谷歌竞拍的不是若干静态文件,而是一家公司多年运营留下的数字化轨迹:
员工如何沟通,项目如何推进,代码如何修改,预算如何形成,航班异常如何处理,管理层又如何把内部信息转化为决策。
这也解释了Spirit数据的特殊价值。
公开网页通常只保留一个组织最终对外发布的结果,例如产品页面、新闻稿、财报和帮助文档,企业内部数据记录的却是抵达结果之前的过程。邮件中的任务分派、聊天中的临时讨论、文档的多次修改、代码审查中的争论,以及运营系统中的异常处理,共同构成了更接近真实工作的上下文。
对于正在发展企业AI和智能体产品的谷歌而言,这类数据可能有助于模型理解复杂组织如何协作,以及一个任务如何跨越邮件、聊天、文档、表格和代码系统逐步完成。这是基于数据结构作出的合理推断,谷歌并未公布具体训练方案,也没有说明哪些模型会使用Spirit的数据。
这批资产也不能被简单描述为“谷歌买走了乘客隐私”。
法院文件明确排除了约9750万份乘客档案、5020万名常旅客会员资料、1370万个活跃邮箱地址、客户电话录音、网站访问记录和客户名单,受到律师—客户保密特权保护的材料,同样不属于交易资产。
但“未包含客户名单”并不意味着这是一笔没有敏感性的普通文件交易,内部邮件、员工数据、财务记录和法律文件依然可能包含能够指向个人或具体事件的信息。
因此,交易协议要求Spirit先把数据交给谷歌指定或认可的第三方进行去标识化,相关成本由谷歌承担,处理完成后,第三方还需证明数据符合适用法律和行业标准。
02 企业“工作记忆”成为AI语料
大模型过去几年的快速进步,很大程度上建立在海量公开内容之上。
但随着高质量公开语料被反复使用,AI公司面临的问题已经从“有没有足够多的数据”,逐渐变为“有没有足够真实、完整且合法可用的数据”。
Spirit的数据恰好具备三个特点。
首先,它足够完整。邮件、聊天、文档、表格、业务系统和源代码能够相互关联,呈现企业工作的连续过程,而不是互联网中彼此割裂的文本片段。
![]()
其次,它足够专业。航空公司涉及航班调度、收益管理、机组安排、维修、燃油、财务和监管等复杂流程。即使Spirit最终经营失败,这些数据仍然记录了一个大型组织如何处理高频、跨部门和强约束任务。经营结果失败,不等于每一项流程数据都失去研究和训练价值。
第三,它拥有相对明确的交易链条。数据通过破产资产拍卖出售,买方支付对价,协议界定纳入和排除范围,并设置法院审批与去标识化条件。与直接抓取互联网内容相比,这种方式至少在资产授权和交易主体层面更清晰。
谷歌此前已表示,除了公开、可抓取的网络内容,公司也在寻找封闭和离线数据、带有增强元数据的信息,以及可用于核验的实时结构化数据。
此外,谷歌官方还透露,正在试验为非公开内容付费的合作模式。
Spirit交易可以被视为这一方向的延伸,AI公司购买的不再只是书籍、新闻或社交平台内容,而是企业真实运作产生的过程数据。
Mercor的参与也强化了这一判断,这家AI数据公司愿意出价750万美元,说明竞标价值并不只来自Spirit的航空业资产,而在于这批数据可以被加工成AI训练或评测材料。
谷歌最终将报价提高至1000万美元,买下的是对这套企业数据的控制权及后续开发空间。
这并不意味着未来每家企业的邮件都能卖出高价。
数据是否完整、是否拥有合法处分权、能否去除个人信息、是否保留跨系统关联,以及能否转化为模型真正需要的训练任务,都会影响其价值。
Spirit的特别之处在于,它留下了一套覆盖大型企业多个部门和系统的连续记录,而破产程序又使这些原本不会进入市场的数据成为可交易资产。
03 匿名化之后,争议并未消失
这笔交易也提出了一个比技术更棘手的问题:员工在企业系统中留下的沟通,究竟只是公司的信息资产,还是也包含个人无法完全让渡的数字痕迹?
从交易文件看,谷歌作出了两项约束:始终以去标识化形式保存和使用数据,不主动把数据与个人或家庭重新关联。如果谷歌未来将数据转交第三方,也需要以合同方式要求接收方遵守相同承诺。
这些措施降低了直接识别个人的风险,却不能自动终结争议。
邮件和聊天并非传统意义上的结构化数据库,姓名可以删除,邮箱地址可以替换,但职位、项目经历、时间节点、语言习惯和上下文组合在一起,仍可能形成独特身份特征。
去标识化能否经受复杂模型的关联分析,最终取决于第三方采用的技术、删除和转换规则,以及谷歌实际获得的数据粒度。目前,这些细节尚未公开。
员工的知情预期同样值得讨论,多数公司都会在制度中说明工作邮箱和协作工具属于企业系统,员工不应期待与私人通信相同的隐私空间。
但“公司可以审计工作邮件”与“公司破产后把多年沟通打包出售给AI公司”,并不是员工日常使用Teams时必然能够预见的同一场景。
社区对此已经出现两种截然不同的反应:
一种观点认为,AI公司为有明确授权的数据付费,比无偿抓取内容更可取;
另一种观点则认为,付费对象是破产企业和债权人,而真正产生邮件和聊天内容的员工并未参与定价,也未必能够选择退出。
这些观点尚不是监管结论,却提示了下一阶段AI数据治理可能面对的矛盾。
Spirit交易最终是否会成为范例,仍取决于法院审批、数据清洗效果以及谷歌的实际用途。
但它已经让一种过去隐藏在资产负债表之外的东西获得了明确价格:
一家企业失败之后,办公楼、飞机和品牌可以出售,员工多年积累的沟通、流程与代码,也可以成为独立拍卖的资产。
对AI行业来说,这可能意味着数据竞争正在进入新的阶段,公开互联网仍然重要,但更有价值的增量数据,也许来自企业防火墙之后,来自那些记录了真实任务如何被理解、拆解、争论和完成的工作现场。
问题也随之而来:
当企业的“工作记忆”成为AI原料,它究竟属于公司、员工,还是未来的模型?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.