网易首页 > 网易号 > 正文 申请入驻

训练1000样本就能超越o1,李飞飞等人画出AI扩展新曲线

0
分享至

机器之心报道

编辑:泽南、陈陈

跟大模型说:要多想。

今年 1 月,DeepSeek R1 引爆了全球科技界,它创新的方法,大幅简化的算力需求撼动了英伟达万亿市值,更引发了全行业的反思。在通往 AGI(通用人工智能)的路上,我们现在不必一味扩大算力规模,更高效的新方法带来了更多的创新可能。

最近一段时间,全世界的科技公司、研究团队都在尝试复现 DeepSeek,但如果这个时候有人说「我还能大幅改进 AI 的推理效率」,你会怎么想?

s1 论文作者,斯坦福大学在读博士 Niklas Muennighoff 表示,DeepSeek r1 令人兴奋,但其缺少 OpenAI 的测试时间扩展图并且需要大量数据。我们推出的 s1 仅使用 1K 样本和简单的测试时间干预即可重现 o1 的预览扩展和性能。

这个新方法叫 s1。本周,斯坦福大学、华盛顿大学等研究机构尝试了最简化实现测试时间扩展(test-time scaling)的方法,仅让模型训练 1000 个问题就获得了超越 o1 的强推理性能。

测试时间扩展是一种有前途的语言建模新方法,它使用额外的测试时间计算来提高模型性能。此前,OpenAI 的 o1 模型展示了这种能力,但并未公开分享其方法。很多工作都在尝试复现 o1,这些尝试包含蒙特卡洛树搜索、多智能体等等。今年 1 月开源的 DeepSeek R1 成功实现了 o1 级别的性能,它是在数百万个样本上通过多训练阶段强化学习实现的。

在 s1 的新工作中,研究人员寻求最简单的方法来实现测试时间扩展。它们构建了一个小型数据集 s1K,其中包含 1000 个问题,并根据三个标准(难度、多样性和质量)与推理轨迹进行配对。

在此基础上,研究人员开发了「预算强制」来控制测试时间计算,方法是强制终止模型的思考过程,或者在模型试图结束时多次将「等待」附加到模型的生成中以延长思考。这有可能会导致模型仔细检查其答案,修复其不正确的推理步骤。

在 s1K 上对 Qwen2.5-32B-Instruct 语言模型进行监督微调(16 块 H100 GPU,26 分钟)并为其设定预算强制后,新模型 s1-32B 在竞赛数学问题上的表现比 o1-preview 高出 27%(MATH 和 AIME24)。

s1 性能与其他大模型的对比。

  • 论文:《s1: Simple test-time scaling》
  • 论文链接:https://arxiv.org/abs/2501.19393
  • 项目链接:https://github.com/simplescaling/s1

测试时间扩展

本文将测试时间扩展方法分为两类:

  1. 序列扩展,即后续计算依赖于先前的计算结果;
  2. 并行扩展,即计算独立运行。

本文专注于序列扩展,因为直观上其具有更好的扩展性,因为后续计算可以基于中间结果进行,从而实现更深层次的推理和迭代优化。

此外,本文还提出了新的序列扩展方法以及对其进行基准测试的方式。

预算强制(Budget forcing)。本文提出了一种简单的解码时间(decoding-time )干预方法,通过在测试时强制设定最大或最小思考 token 数量来实现。图 3 为该方法的一个示例展示,说明了这种简单的方法可以引导模型得出更好的答案。

具体来说,本文通过简单地追加思考结束(end-of-thinking)token 分隔符和「Final Answer:」来强制设定最大 token 数量,从而提前退出思考阶段,使模型提供其当前的最佳答案。为了强制设定最小 token 数量,本文抑制思考结束 token 分隔符的生成,并选择性地在模型的当前推理轨迹后追加字符串「Wait」,以鼓励模型反思其当前生成的内容。

基线。本文用以下方法对预算强制进行基准测试:

(I)条件长度控制方法,该方法依赖于在提示中告诉模型它应该生成多长时间。本文按粒度将它们分组为(a)token 条件控制,在提示中指定思考 token 的上限;(b)步骤条件控制,指定思考步骤的上限;(c)类条件控制,编写两个通用提示,告诉模型思考一小段时间或很长一段时间。

(II)拒绝采样,即采样直到生成符合预定的计算预算。

实验

在训练阶段。本文使用 s1K 数据集对 Qwen2.5-32B-Instruct 进行监督微调,以获得本文的模型 s1-32B。微调是在 16 台 NVIDIA H100 GPU 上使用 PyTorch FSDP 进行的,耗时 26 分钟。

评估。本文采用了三个推理基准进行评估。

  • AIME24 包含 30 个问题,这些问题来自 2024 年 1 月 31 日至 2 月 1 日举行的美国 AIME 数学竞赛。AIME 用来测试模型在算术、代数、计数、几何、数论、概率等领域的能力;
  • MATH500 是一个包含不同难度竞赛数学问题的基准;
  • GPQA Diamond 包含 198 个来自生物学、化学和物理学的博士级科学问题。

其他模型。本文将 s1-32B 与以下模型进行基准测试对比:OpenAI o1 闭源系列模型;DeepSeek r1 开源模型;Qwen 的 QwQ-32B-preview 等模型。

值得一提的是,s1-32B 是完全开源的,包括权重、推理数据和代码。

性能

测试时间扩展。图 1 展示了 s1-32B 在使用预算强制技术后,随着测试时间计算资源的增加,性能的变化情况。

图 4(左)扩展了图 1(中)的图表,结果显示虽然本文可以通过预算强制技术和更多的测试时计算资源提升 AIME24 的性能,但最终在六倍计算量时趋于平缓。可以得出过于频繁地抑制思考结束 token 分隔符可能会导致模型陷入循环重复,而不是持续推理。

图 4(右)展示了在对 Qwen2.5-32B-Instruct 进行 1,000 个样本的训练,从而生成 s1-32B,并为其配备简单的预算强制技术后,它进入了一种不同的扩展范式。通过多数投票在基础模型上扩展测试时间计算资源无法赶上 s1-32B 的性能,这验证了这一直觉,即序列扩展比并行扩展更有效。

图 5 提供了 s1-32B 的生成示例。

样本效率。图 2(右)和表 1 将 s1-32B 与其他模型进行了比较。

结果显示, s1-32B 是样本效率最高的开放数据推理模型。尽管只在额外的 1000 个样本上进行训练,但它的表现明显优于基础模型(Qwen2.5-32B-Instruct)。

r1-32B 在仅使用 SFT 的情况下表现出比 s1-32B 更好的性能,但前者是在 800 倍以上的推理样本上进行训练的。仅用 1000 个样本是否能达到这个性能还是一个悬而未决的问题。

s1-32B 在 AIME24 上几乎与 Gemini 2.0 Thinking 相匹配,因为 s1-32B 是从 Gemini 2.0 中蒸馏出来的,这表明本文的蒸馏程序可能是有效的。

最后,本文还进行了一系列消融实验,感兴趣的读者,可以查看原论文,了解更多内容。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
何智丽大阪想回上海养老,日本护照成拦路虎,回不去的何止是户口

何智丽大阪想回上海养老,日本护照成拦路虎,回不去的何止是户口

老吴教育课堂
2026-10-02 00:04:59
美股转跌!存储巨头,意外下挫!原油飙涨

美股转跌!存储巨头,意外下挫!原油飙涨

证券时报
2026-10-01 23:14:04
识别率接近 100%!德国科学家发出警告,WiFi 竟然可以成为隐形监控

识别率接近 100%!德国科学家发出警告,WiFi 竟然可以成为隐形监控

说宇宙
2026-09-30 18:15:05
高下立判!《马卡报》对比梅西和C罗的国家队结局!

高下立判!《马卡报》对比梅西和C罗的国家队结局!

历史第一人梅西
2026-10-01 22:26:08
西班牙王后莱蒂齐亚又把自己美晕了!冰蓝战袍压全场

西班牙王后莱蒂齐亚又把自己美晕了!冰蓝战袍压全场

喜欢历史的阿繁
2026-10-02 01:36:06
十二天屠城七十万,却被专家吹捧为千古完人、民族英雄,实在可笑

十二天屠城七十万,却被专家吹捧为千古完人、民族英雄,实在可笑

历史人文2
2026-09-29 22:38:32
英超顶级俱乐部高管:若曼城被逐出联赛,其他俱乐部也会损失惨重;DO:若处罚与判决结果相称,我不认为曼城还能留在英超

英超顶级俱乐部高管:若曼城被逐出联赛,其他俱乐部也会损失惨重;DO:若处罚与判决结果相称,我不认为曼城还能留在英超

MUREDS
2026-10-01 23:40:24
南航旧案:男上司和女下属1000天开房410次,做丈夫都没这么勤快

南航旧案:男上司和女下属1000天开房410次,做丈夫都没这么勤快

四海神君
2026-09-21 07:00:22
有人问,要是当年国民党赢了,老蒋主政中国,中国后来会是什么样子?

有人问,要是当年国民党赢了,老蒋主政中国,中国后来会是什么样子?

z千年历史老号
2026-09-03 18:18:17
税收4亿,工资26亿:财政没钱,为什么编内待遇不能动?

税收4亿,工资26亿:财政没钱,为什么编内待遇不能动?

混沌录
2026-07-23 17:11:06
重启后的舞厅乱象:按时收费两百一小时,底层舞客舞女双双熬日子

重启后的舞厅乱象:按时收费两百一小时,底层舞客舞女双双熬日子

成都人的故事
2026-09-10 07:43:30
【2026.10.1】张新成不是单身?杜江霍思燕好的夫妻?李昀锐后面发展?刘学义红利?丞磊没啥代言?好迷张哲华,能讲讲他?

【2026.10.1】张新成不是单身?杜江霍思燕好的夫妻?李昀锐后面发展?刘学义红利?丞磊没啥代言?好迷张哲华,能讲讲他?

娱乐真爆姐
2026-10-01 23:34:57
好奇查了一下陈妤颉的父亲,不查不知道,一查挺意外

好奇查了一下陈妤颉的父亲,不查不知道,一查挺意外

李博世财经
2026-10-01 09:35:29
花这么大力气抓基层党建,到底图什么?

花这么大力气抓基层党建,到底图什么?

画生笔记
2026-09-12 08:57:54
微信付款要变了!10月12日正式生效,转账花钱一定要留心

微信付款要变了!10月12日正式生效,转账花钱一定要留心

呼呼历史论
2026-10-02 05:43:27
真相来了,裴轶被盯住的原因终于找出来了!

真相来了,裴轶被盯住的原因终于找出来了!

叒女紫121
2026-09-29 11:36:51
哈佛大学研究发现:人生回报率最高的,是每天坚持这两个习惯

哈佛大学研究发现:人生回报率最高的,是每天坚持这两个习惯

心理观察局
2026-07-01 07:37:28
库页岛打出“三绝不”:不属于中国、不像俄罗斯、不承认历史

库页岛打出“三绝不”:不属于中国、不像俄罗斯、不承认历史

纪史行者
2026-09-19 17:40:52
国台办:中国共产党鲜明提出收复台湾的主张,支持和推动了台湾光复运动

国台办:中国共产党鲜明提出收复台湾的主张,支持和推动了台湾光复运动

京彩台湾
2026-09-30 22:15:05
入管10月1日更新永住指南,新规不再单纯以“在留年限”为核心

入管10月1日更新永住指南,新规不再单纯以“在留年限”为核心

东京在线
2026-10-01 23:12:56
2026-10-02 07:52:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14115文章数 142741关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

"大明湖最有腔调爷爷"国庆夜现身 有外地粉丝特意赶来

头条要闻

"大明湖最有腔调爷爷"国庆夜现身 有外地粉丝特意赶来

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

数码
艺术
家居
教育
手机

数码要闻

存储又要涨价了!AI疯狂吞噬产能:Q4 DRAM和NAND最高涨20%

艺术要闻

他历尽苦难,却画出最令人心碎的女人!艾斯特凡笔下的女性,美到不敢直视!

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

从特殊到一般,一个视频学会!

手机要闻

奇安信盘古石取证宣布适配Android 17:支持微信已删除多媒体碎片重组

无障碍浏览 进入关怀版