2025年1月31日,OpenAI发布其“推理”模型系列的新版本o3。Epoch AI估算,平均每题花费30美分,o3可在GPQA Diamond上取得75%的分数——这是一套覆盖博士级物理、化学、生物的多选题考试。
不到18个月后,OpenAI发布GPT-5.6 Luna。它取得了同样的分数——每题仅需0.0004美元。这意味着在不到18个月里,“思考”的价格下降了725倍。研究团队打了个比方:这相当于一辆新车标价从5万美元降至69美元。
![]()
研究团队表示,历史上似乎还没有哪种通用技术能以如此快的速度变得如此便宜。
为衡量这些趋势,研究团队使用了一套新的、更全面的数据集,涵盖过去三年五个AI性能基准,覆盖数学、硬科学和技巧类游戏。
在这段时间里,研究团队发现,达到某一给定性能水平的价格每季度下降约47%,即每年13倍。游戏类谜题的降幅较慢,约为每季度39%–43%(每年7–10倍);数学问题的进步更快,为每季度50%–52%(每年16–19倍)。
给定性能水平的成本下降确实会随时间放缓,不过这一模式并不普遍。一种可能的解释是:当某一性能水平刚被实现时,AI公司可以短暂收取溢价,随后竞争和技术进步迅速压低价格。随着时间推移,这一动力会放缓。对五个主要基准取平均,成本最初每季度下降66%(每年75倍)。两年后,降幅减半,为每季度32%(每年4.7倍)。
该分析带有重要限制。AI公司可能针对某些基准专门训练模型(“benchmaxxing”),导致基准上的进步快于真实任务。即便并非如此,在基准上表现好也不等于能完成有用的工作。由于研究聚焦“前沿”——达到任一给定性能水平的最便宜模型——它隐含假设了一个会为每项任务不断寻找最具成本效益模型的AI用户,而真实用户不会如此频繁地切换模型,因此不会获得同样的节省。研究数据不完整且有噪声:时间跨度仅三年,且未包含所有AI模型与基准的组合。不同模型、基准、时间段和性能区间的价格下降情况不同,对这类多样经验取平均也有许多合理方式。总体而言,研究团队认为其底线数字大致能代表现实,但不应被当作精确值来读。
研究团队并非首次量化AI价格下降速度。2024年,Guido Appenzeller为Andreessen Horowitz撰写的一篇文章记录:GPT-3公开发布后的三年里,大模型成本下降了1000倍,即每年10倍。几个月后,2025年3月,Epoch AI的一项分析发现,六个性能基准上的年降幅在9–900倍之间。
这两项早期分析衡量的是能够达到某一性能水平的模型的每token价格,而非达到给定性能的实际成本。随着推理模型出现——OpenAI于2024年12月发布o1——忽略这一区别变得更加成问题。推理模型可以消耗多得多的token,但因此能从更小、每token运行成本更低的底层LLM中提取出良好性能。
2025年9月,Håvard Tveit Ihle在LessWrong上分享了一项分析,直接对比了两套编程挑战的性能与成本。该分析发现,成本每1.4–2个月减半(每年64–380倍)。
迄今最详尽的分析是2026年3月Gundlach等人的论文。它同样对比实际成本与性能。与本次分析一样,它既估计全部数据中的趋势,也估计任一给定时间定义成本前沿的模型子集中的趋势。它还按性能水平(高端价格下降更快)和模型类型(开源或闭源、稠密或专家混合)做了拆分。总体而言,他们发现每年下降5–10倍。
本次分析的主要新意在于,使用一种能捕捉每个模型完整“成本-性能连续谱”的方法来分析成本趋势。如果一个LLM能在某基准上得80%,为此花费1美元,而另一个最高得60%,花费0.50美元,那么哪个更具成本效益并不明显。也许更强的模型如果用更少的推理token运行,能以比更弱模型更便宜的方式达到60%。更一般地说,研究团队关心的是画出成本效益的“帕累托”前沿——在任一给定时间,从可用模型中达到每个性能水平的最便宜方式。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.