网易首页 > 网易号 > 正文 申请入驻

训练1000样本就能超越o1,李飞飞等人画出AI扩展新曲线

0
分享至

机器之心报道

编辑:泽南、陈陈

跟大模型说:要多想。

今年 1 月,DeepSeek R1 引爆了全球科技界,它创新的方法,大幅简化的算力需求撼动了英伟达万亿市值,更引发了全行业的反思。在通往 AGI(通用人工智能)的路上,我们现在不必一味扩大算力规模,更高效的新方法带来了更多的创新可能。

最近一段时间,全世界的科技公司、研究团队都在尝试复现 DeepSeek,但如果这个时候有人说「我还能大幅改进 AI 的推理效率」,你会怎么想?

s1 论文作者,斯坦福大学在读博士 Niklas Muennighoff 表示,DeepSeek r1 令人兴奋,但其缺少 OpenAI 的测试时间扩展图并且需要大量数据。我们推出的 s1 仅使用 1K 样本和简单的测试时间干预即可重现 o1 的预览扩展和性能。

这个新方法叫 s1。本周,斯坦福大学、华盛顿大学等研究机构尝试了最简化实现测试时间扩展(test-time scaling)的方法,仅让模型训练 1000 个问题就获得了超越 o1 的强推理性能。

测试时间扩展是一种有前途的语言建模新方法,它使用额外的测试时间计算来提高模型性能。此前,OpenAI 的 o1 模型展示了这种能力,但并未公开分享其方法。很多工作都在尝试复现 o1,这些尝试包含蒙特卡洛树搜索、多智能体等等。今年 1 月开源的 DeepSeek R1 成功实现了 o1 级别的性能,它是在数百万个样本上通过多训练阶段强化学习实现的。

在 s1 的新工作中,研究人员寻求最简单的方法来实现测试时间扩展。它们构建了一个小型数据集 s1K,其中包含 1000 个问题,并根据三个标准(难度、多样性和质量)与推理轨迹进行配对。

在此基础上,研究人员开发了「预算强制」来控制测试时间计算,方法是强制终止模型的思考过程,或者在模型试图结束时多次将「等待」附加到模型的生成中以延长思考。这有可能会导致模型仔细检查其答案,修复其不正确的推理步骤。

在 s1K 上对 Qwen2.5-32B-Instruct 语言模型进行监督微调(16 块 H100 GPU,26 分钟)并为其设定预算强制后,新模型 s1-32B 在竞赛数学问题上的表现比 o1-preview 高出 27%(MATH 和 AIME24)。

s1 性能与其他大模型的对比。

  • 论文:《s1: Simple test-time scaling》
  • 论文链接:https://arxiv.org/abs/2501.19393
  • 项目链接:https://github.com/simplescaling/s1

测试时间扩展

本文将测试时间扩展方法分为两类:

  1. 序列扩展,即后续计算依赖于先前的计算结果;
  2. 并行扩展,即计算独立运行。

本文专注于序列扩展,因为直观上其具有更好的扩展性,因为后续计算可以基于中间结果进行,从而实现更深层次的推理和迭代优化。

此外,本文还提出了新的序列扩展方法以及对其进行基准测试的方式。

预算强制(Budget forcing)。本文提出了一种简单的解码时间(decoding-time )干预方法,通过在测试时强制设定最大或最小思考 token 数量来实现。图 3 为该方法的一个示例展示,说明了这种简单的方法可以引导模型得出更好的答案。

具体来说,本文通过简单地追加思考结束(end-of-thinking)token 分隔符和「Final Answer:」来强制设定最大 token 数量,从而提前退出思考阶段,使模型提供其当前的最佳答案。为了强制设定最小 token 数量,本文抑制思考结束 token 分隔符的生成,并选择性地在模型的当前推理轨迹后追加字符串「Wait」,以鼓励模型反思其当前生成的内容。

基线。本文用以下方法对预算强制进行基准测试:

(I)条件长度控制方法,该方法依赖于在提示中告诉模型它应该生成多长时间。本文按粒度将它们分组为(a)token 条件控制,在提示中指定思考 token 的上限;(b)步骤条件控制,指定思考步骤的上限;(c)类条件控制,编写两个通用提示,告诉模型思考一小段时间或很长一段时间。

(II)拒绝采样,即采样直到生成符合预定的计算预算。

实验

在训练阶段。本文使用 s1K 数据集对 Qwen2.5-32B-Instruct 进行监督微调,以获得本文的模型 s1-32B。微调是在 16 台 NVIDIA H100 GPU 上使用 PyTorch FSDP 进行的,耗时 26 分钟。

评估。本文采用了三个推理基准进行评估。

  • AIME24 包含 30 个问题,这些问题来自 2024 年 1 月 31 日至 2 月 1 日举行的美国 AIME 数学竞赛。AIME 用来测试模型在算术、代数、计数、几何、数论、概率等领域的能力;
  • MATH500 是一个包含不同难度竞赛数学问题的基准;
  • GPQA Diamond 包含 198 个来自生物学、化学和物理学的博士级科学问题。

其他模型。本文将 s1-32B 与以下模型进行基准测试对比:OpenAI o1 闭源系列模型;DeepSeek r1 开源模型;Qwen 的 QwQ-32B-preview 等模型。

值得一提的是,s1-32B 是完全开源的,包括权重、推理数据和代码。

性能

测试时间扩展。图 1 展示了 s1-32B 在使用预算强制技术后,随着测试时间计算资源的增加,性能的变化情况。

图 4(左)扩展了图 1(中)的图表,结果显示虽然本文可以通过预算强制技术和更多的测试时计算资源提升 AIME24 的性能,但最终在六倍计算量时趋于平缓。可以得出过于频繁地抑制思考结束 token 分隔符可能会导致模型陷入循环重复,而不是持续推理。

图 4(右)展示了在对 Qwen2.5-32B-Instruct 进行 1,000 个样本的训练,从而生成 s1-32B,并为其配备简单的预算强制技术后,它进入了一种不同的扩展范式。通过多数投票在基础模型上扩展测试时间计算资源无法赶上 s1-32B 的性能,这验证了这一直觉,即序列扩展比并行扩展更有效。

图 5 提供了 s1-32B 的生成示例。

样本效率。图 2(右)和表 1 将 s1-32B 与其他模型进行了比较。

结果显示, s1-32B 是样本效率最高的开放数据推理模型。尽管只在额外的 1000 个样本上进行训练,但它的表现明显优于基础模型(Qwen2.5-32B-Instruct)。

r1-32B 在仅使用 SFT 的情况下表现出比 s1-32B 更好的性能,但前者是在 800 倍以上的推理样本上进行训练的。仅用 1000 个样本是否能达到这个性能还是一个悬而未决的问题。

s1-32B 在 AIME24 上几乎与 Gemini 2.0 Thinking 相匹配,因为 s1-32B 是从 Gemini 2.0 中蒸馏出来的,这表明本文的蒸馏程序可能是有效的。

最后,本文还进行了一系列消融实验,感兴趣的读者,可以查看原论文,了解更多内容。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
我妈出轨20年了,我爸忍耐了整整20年,我妈50岁生日那天,我才知道我爸有多狠

我妈出轨20年了,我爸忍耐了整整20年,我妈50岁生日那天,我才知道我爸有多狠

千秋文化
2026-08-12 20:13:55
网传追觅大家电解散!供应商维权讨要欠款

网传追觅大家电解散!供应商维权讨要欠款

鞭牛士
2026-08-16 08:54:07
知名综艺突发直播事故!误放画面流出

知名综艺突发直播事故!误放画面流出

南方都市报
2026-08-16 13:53:22
赖清德副手谈统一,郑丽文、蒋万安、卢秀燕火力全开,韩国瑜沉默

赖清德副手谈统一,郑丽文、蒋万安、卢秀燕火力全开,韩国瑜沉默

鹤羽说个事
2026-08-16 19:29:37
52岁前成人片女星詹娜·詹姆森与女性伴侣闪婚,婚后自曝“内心从未如此平静”

52岁前成人片女星詹娜·詹姆森与女性伴侣闪婚,婚后自曝“内心从未如此平静”

影视情报室
2026-08-15 01:30:32
中国最良心的 8 个AAAAA景区,全部免费,不收门票,争取每年去一个!!

中国最良心的 8 个AAAAA景区,全部免费,不收门票,争取每年去一个!!

旅游周刊
2026-08-16 20:23:41
法庭文件曝前参议员Sinema任职期间与已婚保镖多次发生性关系

法庭文件曝前参议员Sinema任职期间与已婚保镖多次发生性关系

报错免疫体
2026-08-16 02:09:29
“滚回你们自己的国家!”日本42万穆斯林遭仇恨,风向彻底变了

“滚回你们自己的国家!”日本42万穆斯林遭仇恨,风向彻底变了

风流女汉
2026-06-15 15:52:33
松岛辉空:我最擅长对付王楚钦,比张本智和更让中国球员感到恐惧

松岛辉空:我最擅长对付王楚钦,比张本智和更让中国球员感到恐惧

排球黄金眼
2026-08-16 15:57:50
王水牛被爆查出艾滋病,评论区求赐名的女粉丝纷纷注销账号,曾称自己在上海每月开销3-5万

王水牛被爆查出艾滋病,评论区求赐名的女粉丝纷纷注销账号,曾称自己在上海每月开销3-5万

Mr王的饭后茶
2026-08-14 17:45:56
“精日”分子已形成势力,不断挑战民族底线,真该狠狠严打!

“精日”分子已形成势力,不断挑战民族底线,真该狠狠严打!

瑛派儿老黄
2026-08-11 16:44:23
袁咏仪首度公开道歉 透露儿子被逼出情绪病:妈咪对不起你,为明星身份带给孩子压力感到内疚

袁咏仪首度公开道歉 透露儿子被逼出情绪病:妈咪对不起你,为明星身份带给孩子压力感到内疚

TVB资讯台
2026-08-15 22:04:55
那个特奥多罗,快回答这16问!

那个特奥多罗,快回答这16问!

极目新闻
2026-08-16 00:42:29
奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

轻扬墨雨
2026-08-14 13:21:23
很多人呼吁消防队伍重新回归武警建制?全网热议的提议,为啥根本行不通

很多人呼吁消防队伍重新回归武警建制?全网热议的提议,为啥根本行不通

袁老师说历史
2026-08-15 13:24:02
土耳其总统埃尔多安:加入欧盟已不是土耳其的优先事项,欧盟的态度最终将导致“欧洲自身成为输家”,土耳其对欧盟已经“不抱任何期待”

土耳其总统埃尔多安:加入欧盟已不是土耳其的优先事项,欧盟的态度最终将导致“欧洲自身成为输家”,土耳其对欧盟已经“不抱任何期待”

极目新闻
2026-08-16 15:41:15
谷爱凌发文否认恋情:“又有新恋情?总是最后一个知道的,散了散了”

谷爱凌发文否认恋情:“又有新恋情?总是最后一个知道的,散了散了”

韩小娱
2026-08-16 21:10:15
太治愈!小菲带箖箖夜游珠江大方晒幸福,真实父爱圈粉无数

太治愈!小菲带箖箖夜游珠江大方晒幸福,真实父爱圈粉无数

两只米老鼠
2026-08-16 21:37:38
伊指挥官:两架苏-24炸美基地后被击落,3名飞行员被卡塔尔俘虏

伊指挥官:两架苏-24炸美基地后被击落,3名飞行员被卡塔尔俘虏

全球风情大揭秘
2026-08-17 00:28:07
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
2026-08-17 03:20:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13772文章数 142718关注度
往期回顾 全部

科技要闻

210亿美元,黄仁勋投了马斯克

头条要闻

如是书院被关停:22岁女生被打疯 大小便失禁生死不明

头条要闻

如是书院被关停:22岁女生被打疯 大小便失禁生死不明

体育要闻

因莫比莱:普通人的平凡故事

娱乐要闻

谷爱凌发文否认恋情:“散了散了”

财经要闻

事关8万亿养老金!长周期考核落地中

汽车要闻

杨洋成001号车主 岚图追光S正式上市

态度原创

房产
健康
亲子
教育
军事航空

房产要闻

金茂、招商,海南多个岗位招人!

专家解答青少年脊柱侧弯七大问题

亲子要闻

宝蓝邀请邻居姐姐来家里一起玩,结果把家里整的乱七八糟。

教育要闻

160支学生队伍在成都打了一场辩论赛,AI时代做这事还有意义吗

军事要闻

伊朗:对每名入境美国军人悬赏50亿土曼

无障碍浏览 进入关怀版