2025年3月,Anthropic CEO Dario Amodei在对外关系委员会上放出豪言:AI将在三到六个月内编写90%的代码,十二个月内几乎全部代码都由AI完成。这个十二个月的期限在2026年3月已经过去,几乎没有人回头核查这个预言是否兑现。
这就是AI预测圈的奇特礼仪——预言响亮、带着明确日期、以绝对自信的口吻发布,然后日期到了,所有人又转向下一个新预言。没有记分牌,没有复盘,没有问责。于是有人自己动手建了一个。
![]()
一位开发者(化名Whizi项目作者)在2025年2月基于Altman关于2025年的判断,将代理工作流(agent workflows)纳入产品规划。六周后,他算了一笔账——单次多步骤代理运行的算力成本对比月度订阅收入,果断砍掉了这个项目。六周的个人路线图,浪费在别人的预测上。他随后搜集了所有能找到的、带有明确日期且已过期的2024年和2025年AI预测,最终筛选出18条进行打分。
评分规则:按字面承诺兑现
评分标准很直接:一条预测按它自己承诺的内容和期限来评判。你说9月达到90%,结果9月只有30%,那"最终会实现"不是成绩,是借口。
Altman的"AI打工人":及格边缘
Sam Altman在2025年1月预测:"我们相信,2025年我们可能会看到第一批AI代理'加入劳动力大军',并实质性改变公司的产出。"
现实如何?MIT的NANDA项目在2025年8月发现,95%的企业生成式AI试点项目没有产生可衡量的盈亏影响。卡内基梅隆大学用AI代理组建了一家假公司,测量它们完成的办公室工作:最好的模型完成了30.3%的任务。一个完成率30%的员工不会"加入你的劳动力大军",他们会在试用期被淘汰。
唯一的例外是软件公司内部——编码代理确实改变了产出。综合评级:C-。
Benioff的十亿代理:差34000倍
Marc Benioff在2024年9月承诺:"我们的愿景很大胆:到2025年底,用Agentforce赋能十亿个代理。"
Salesforce到2026年初报告了约2.9万个累计Agentforce交易,年经常性收入突破10亿美元。这是一门真实的生意,但距离承诺差了约34000倍(按交易数而非代理数计算)。最讽刺的细节:Salesforce现在报告的是"代理工作单元服务量"(38亿个),而不是代理数量。当数字达不到目标时,就换一个计量单位。评级:F。
Klarna的700人等效:人类回归
Klarna在2024年2月宣称其AI助手"完成了相当于700名全职代理的工作量"。2025年5月,CEO Sebastian Siemiatkowski改口并开始重新招聘人类员工:"我们过于关注效率和成本,结果是质量下降。"AI保留了常规工单,人类回来处理所有重要事务。敢于公开实验并承认结果,值得肯定。评级:C。
Amodei的90%:方向对了,分母错了
Amodei的90%预测,方向正确但分母错误。Google表示其新代码中75%由AI生成,但"新代码"的定义和"所有代码"的基数完全不同。当分母是整个代码库时,90%的承诺显得遥遥无期。
18条预测的残酷记分牌
这18条预测中,没有一条完全兑现。最接近的是那些限定范围、明确场景的预测——比如编码辅助工具在特定团队中的采用率。而所有宏大叙事——"AI改变公司产出""十亿代理""90%代码"——全部落空。
唯一得分较高的人,并没有因为预测准确而获得任何回报。这或许解释了为什么AI预测圈没有人愿意做复盘:准确预测没有奖励,而错误预测没有惩罚。
为什么预测总是过度自信?
一个可能的原因是激励结构。发布大胆预测的人获得关注、融资和话语权;而修正预测的人只会被遗忘。另一个原因是技术发展的非线性——AI能力确实在增长,但增长曲线远比线性预测复杂得多。
那位砍掉Whizi项目的开发者总结道:"六周时间让我明白,别人的预测不能替代自己的计算。AI预测的价值不在于准确性,而在于它迫使你去验证——而验证的过程,才是真正有用的部分。"
下一次有人告诉你"AI将在X个月内做到Y"时,不妨问一句:上次的预测,你复盘了吗?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.