大语言模型的进步,通常被报道为“最强模型现在能做什么以前做不到的事”。这个方向确实惊人:每一步突破,都让模型处理一类此前无法企及的任务——从修复横跨整个代码库的bug,到最近在悬而未决的数学难题上取得进展。
但还有第二个被忽视的进步方向:以多低的价格买到某一水平的能力。大量实用工作并不需要最聪明的模型,只需要一个“够用”的模型,被重复调用成千上万次。比如通读某个主题的所有科学论文、检查档案中每份合同的特定条款、或者总结大型论坛的每个讨论串——这类任务的关键不是“有没有模型能做”,而是“预算内能不能做一万次”。天花板解锁新任务,地板解锁规模。
![]()
成本暴跌:从数千美元到一百美元
选择模型时,你其实是在能力与单次调用成本之间做权衡。在代理式编程(agentic coding)上,作者几乎只关注能力,因为更高质量的工作值得花更多钱,即使存在便宜得多且尚可胜任的模型。
但最近,作者注意到了“地板”的成本。他们正在测量DANDI Archive上共享的数据集被后续出版物引用的频率——这意味着要用模型阅读约一万篇候选论文,逐一判断是否真正复用了数据。按今天的价格,用一款能力在春季还处于前沿的模型跑完全部语料,成本仅一百多美元;而按今年三月的价格,同样的能力跑同样一遍,要花几千美元;一年前,这种能力根本有价无市。
正是“地板”的变化,让这项分析从“只能抽样做”变成了“可行的项目”。作者坦言,他对成本谱系上的进步感到惊讶,尤其是便宜模型变得有多聪明。
Pareto前沿:智能与价格的真实边界
Artificial Analysis 过去两年一直在对数百个模型的智能与价格进行基准测试,其公开数据足以重构这一权衡关系。下图展示了智能指数与单任务成本的关系,为不同能力水平的模型提供了现实成本估算。
图中顶部的线是他们定义的“Pareto线”——在给定价格点上最具能力的模型。这条线描述了LLM的真实前沿。作者从artificialanalysis.ai拉取数据,观察Pareto前沿如何随新模型发布而移动。他认为,值得停下来回顾这一进展。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.