一个基准测试的跑分成本,19个月里跌了99.95%。ARC Prize 公布的数据显示,在 ARC-AGI-1 上达到 75% 分数,成本从 o3-preview 的每任务 26 美元,降到了 DeepSeek V4 Flash 的每任务 0.01 美元。
这不是某一次降价,是一条持续下坠的曲线。19 个月,从二十多美元到一美分,中间没有反弹。
![]()
更快的版本:6个月跌99.44%
ARC-AGI-2 上的曲线更陡。同样达到 75% 分数,成本从 Gemini 3 Deep Think 的每任务 13.62 美元,降到 Dots3-Note Preview 的每任务 0.08 美元,只用了 6 个月。
两个基准,两条曲线,方向一致:能跑出高分的模型越来越多,跑一次的价格越来越低。
便宜下来的到底是什么
把成本拆开看,变化来自两端。一端是模型本身,同样的任务用更少的算力就能完成;另一端是推理价格,单位 token 的报价在往下走。
26 美元到 0.01 美元,差的不只是钱。它意味着一个原本只有预算充足的研究团队才跑得起的测试,现在可以随手跑上几千次。
ARC Prize 这条数据发布后,浏览量停在 13.1K。数字不大,但曲线本身够说明问题:跑分这件事,正在从奢侈品变成日用品。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.