AI能否加速自身进化,并且进化得越来越快?这个问题的答案一直很难衡量,因为它需要把几种成本放在同一杆秤上:人类劳动、实验算力,还有AI本身的运行开销。
现在,研究机构METR提出了一个名为“支出地平线”的新指标来解决这个难题。它的逻辑很直接:把AI和人类拉到一起比比,看看要达到同样的性能提升,各自得花多少钱。“支出地平线”就是那个让双方花费相等的临界点。预算低于这个点时,AI更划算;高于这个点,雇人干反而更省钱。
![]()
这个思路,源自METR在以往测试中观察到的一种模式:AI智能体在解决简单、低成本的任务时,速度往往比人快。但随着预算增加、任务变难,它们就开始掉队了。
衡量性价比,这个新指标比传统测试强在哪
在METR看来,跟常规的AI基准测试相比,“支出地平线”有两个优势。第一,它不给一个简单的通过或失败,而是产出一个精细的值,告诉你花多少钱能换来多少性能提升。第二,它把所有开销都换算成同一种货币,这不仅包括AI运行费,也把实验所需的昂贵算力和人类劳动时间统统算了进去。
NanoGPT速度赛里的成本账:人类一个百分点提升要花2500美元
METR选定的试验场,是NanoGPT速度赛。这是一个公开的社区项目,志愿者们比拼的是谁能以最快速度训练出一个AI语言模型。任务本身是固定的,能改的只有训练方法。从2024年5月至今,在标准化硬件上,所需的训练时间已经从大约45分钟锐减到2分钟以内,经由82个被记录下来的改进步骤实现。
为了搞清楚人类的劳动成本,METR采访了项目里两位最活跃的贡献者,还让Opus-4.6模型估算了一下每个改进背后的工作量。两种方式得出的结果差不多:每1%的性能提速,背后约莫是16个小时的人力投入。按每小时150美元的假设工资算,一个百分点的提速,费用大约是2500美元。METR特别强调,这个数字相当不确定。访谈中有一个细节值得注意:大部分时间其实是花在了那些最终没有奏效的想法上。
AI的表现出人意料,效果仅在最便宜时占优
轮到AI上场时,METR让六款AI模型各自为战,处理同一个任务。它们不是从零开始,而是从一个已经高度优化的状态起步,也就是2026年3月创下纪录的第78号版本,每次运行最多可以烧掉1万美元的算力和运营成本。结果却不尽如人意:估算出的“支出地平线”在0到3300美元之间。(原文引用在此处被截断)
模型之间的差距非常悬殊。在极低的预算水平下,部分AI表现尚可,但整体来看,这个结果指向一个尴尬的结论:至少就当前一代模型而言,只有在只有极低预算的情况下,AI的性价比才可能优于人类。一旦任务预算充足、需要更复杂的创造性工作时,更便宜也更好用的,依然是人。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.