硅谷与华尔街的顶级科技智库最近丢出了一份让不少国内大模型厂商脊背发凉的分析报告。
这听起来像是一个天大的荒谬悖论:
![]()
全球最大的开放网页抓取数据库 Common Crawl 曾公布过一组刺眼的数据:
这种极度脱节并非因为中国人不爱表达,而是因为我们的知识沉淀彻底“移居”了。
回顾 PC 时代,互联网是平的。那是一个 Robots.txt 协议尚存温情的时代——哪怕你是一个个人博客、猫扑论坛还是天涯社区,搜索引擎的爬虫都能畅行无阻,把全人类的智慧搬进公域知识库。
结果就是,最优质的人类思考——那些深度的行业分析、真实的生活避坑指南、生动的问答交流——全部被扣压在了私域 App 的“地下室”里。
![]()
公域网页没有正餐吃,大模型厂商为了喂饱几千亿参数的算力吞噬兽,逼出了极其赛博朋克的现实版剧情。
在华南某些不为人知的地下机房里,挂满了一面面由数万台二手安卓手机构成的“真机群控墙”。
更讽刺的是,由于直接使用这些盗版私域数据面临极高的版权风险,大模型行业还衍生出了“数据洗钱”(Data Laundering)流程:
先将非法偷抓来的高质数据喂给一个小型开源模型,让它用自己的话“重写一遍”,洗掉原始版权特征,再把重写后的“无公害语料”注入核心大模型的训练集里。
当全网公域被大厂围墙撕裂后,留下来的公开 Web 变成了什么?
![]()
西方机构看空中国 AI,关注的是一个冷酷的资本算盘:“互联网围墙阻碍了 AI 巨头商业变现的上限。” 华尔街心疼的是算法少赚了钱,算力浪费了成本。
被墙折磨得最深的,恰恰是每天生活在这些“赛博领地”里的普通打工人。
不知从何时开始,我们习以为常的“搜索引擎”彻底变成了“废纸回收站”。你现在想找一个具体的软件报错代码解法,或者一份真实的旅行避坑攻略:
第二步:掏出手机打开小红书,终于找到一条对症的帖子,翻到一半弹出弹窗:“请下载 App 查看完整内容”。
第六步:走投无路的你尝试问大模型,大模型因为根本看不到小红书和微信墙里的内容,只能满嘴胡言乱语,给你生成了一个看似合理但根本不存在的“假代码”。
从 PC 时代的“一次搜索,直达知识”,到移动时代的“下载 5 个 App,注册 3 个账号,被骗 2 次会员”,人类获取信息的边际成本不仅没有随着技术进步下降,反而呈现指数级爆发。
我们从“信息平权”的理想国,一夜跌落进了“赛博封建主义”:
平台巨头是领主,数据是他们领地里的地下矿产,而我们每一个普通用户,不仅是免费贡献数据的“数字农奴”,想回过头看一眼自己和同类创造的知识,还得按次缴纳“过路费”。
![]()
回顾科技工业史,数据割裂的教训并不陌生。
19 世纪工业革命初期,英国和美国的铁路公司为了抢占领地,纷纷采用各自独有的轨距(宽轨、窄轨、标准轨),导致火车无法跨线运行,货物在交界处必须全部人工卸下再重新装车,造成了极其惊人的物流损耗。
直到国家层面强行统一“标准轨距”,工业时代的物流网络才真正爆发。
![]()
![]()
外媒看空的,或许只是一次基于商业割裂做出的大模型性能预测;
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.