网易首页 > 网易号 > 正文 申请入驻

35B干赢万亿参数大模型!上交大AI开始给自己造题还能自我迭代了

0
分享至

编辑|+0、杨文

AI 开始参与造 AI,下一步学什么成了新问题。

Ilya Sutskever 去年底指出,预训练数据终将耗尽,单纯把现有训练规模再放大 100 倍,很难带来根本性变化。经历数年的规模扩张后,AI 行业正在重新进入「研究时代」,下一次能力跃迁需要新的训练方法和学习机制。

行业的注意力也开始转向研究流程本身。昨天,在谷歌效力 27 年的技术元老 Jeff Dean 官宣离职,拉着 Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals 三位老伙计共同创办 Discovery Loop。而这家公司干的,就是自动化科学与工程中的完整实验循环,让 AI 提出实验、完成实现、运行评估,再根据结果调整下一步方向。



那么问题来了,当模型越来越擅长解决问题,下一批真正有价值、足够困难的问题该由谁提出?这些问题的答案又该如何可靠验证?

来自上海交通大学人工智能学院、深势科技和上海算法创新研究院的无尽前沿团队,最近给出的思路是让 AI 参与创建、筛选和迭代自己的训练任务,并由此发布科研大模型 BigBang-V1



  • 模型:https://huggingface.co/endless-frontier/BigBang-v1
  • 项目主页:https://endlessfrontier.tech/
  • 论文标题:BigBang: Pursuing Open-Ended Intelligence through Self-Evolving Synthesis of Verifiable Frontier Tasks
  • 完整技术报告:https://endlessfrontier.tech/assets/paper.pdf

BigBang-V1 基于 Qwen3.6-35B-A3B 进行后训练,在后训练阶段使用了完全由 AI 合成的数据。实验结果显示,在所选 35B 规模模型中,BigBang-V1 在 10 项评测上取得最高已报告分数,并在若干高难度任务上达到或超过部分更大规模的前沿模型。



BigBang-V1 与代表性闭源、开源前沿模型及 35B 参数规模模型在长程搜索、编程、科学研究和 AI 研究基准上的对比。“-” 表示相关分数尚未公开或未经测试。

又一次「小模型挑战大模型」的叙事?并非如此,BigBang-V1 的真正亮点是它背后的数据生产方式。

在传统流程中,人类专家确定方向、设计问题、准备答案并检查结果,模型负责学习已经整理好的数据。BigBang 则试图把其中更多工作交给 AI,它不仅生成问题和答案,还参与修改数据生产程序、调用工具完成任务、检查候选结果,并根据数据是否切实提升了模型能力调整下一轮合成策略。

过去,AI 主要是被出题、被训练、被考试,BigBang-V1 则让 AI 开始参与决定下一代模型应该学习什么

模型越来越强,人类开始出不动题了

Scaling Law 大家已经耳熟能详,增加参数、投入更多算力、收集更多数据,模型能力通常也会随规模增长而提升。

过去几轮模型能力的跃迁,几乎都可以从参数、算力和数据的扩张中找到解释。久而久之,「更大」也就成了「更强」的同义词。

但模型也不能只依靠现有数据持续扩张,随着高质量数据和有效任务被反复使用,继续增加投入所带来的边际收益也会逐渐下降。

尤其当模型开始接近人类专家在部分任务上的水平,下一批真正能让模型继续进步的训练任务,要从哪里来

这和「互联网上还有多少文本」并不是一回事。

网上的数据当然还有很多,但具备训练价值的新任务未必充足。模型已经反复见过的知识,再学十遍也难以扩展能力边界。真正困难的是,如何持续提出模型还不会、又值得学习的问题。

这类问题通常需要专业研究人员来设计、求解和验证。GPU 可以采购,专家时间却很难按卡扩容。大模型几天就能消耗掉海量数据,人类专家却无法突然进入倍速模式。哪怕一天喝三杯咖啡,也很难跟上计算集群的数据胃口。

更准确地说,模型缺的不只是题,而是「题目加反馈」。

一道题足够难却无法判断答案对错,很难形成稳定的训练信号;一道题容易验证却低于模型当前能力水平,训练价值同样有限。

真正适合持续训练的任务,需要同时满足两个条件:足够前沿,也能够验证。前沿性决定模型能否学到新东西,可验证性决定它学到的是不是对的。

BigBang 把科学研究选作了这两个条件的交汇点。

科学会不断产生新问题,同时提供形式化证明、程序执行、数值计算、模拟器、数据库、实验反馈和领域规则等多种验证手段。模型的答案可以直接放进工具里跑一遍,不必只靠另一个模型来评判。

更重要的是,解决一个完整的科学问题,往往需要搜索资料、判断证据、提出假设、编写代码、调用工具、分析结果,并在失败后调整路线。科学因此成为训练通用问题解决能力的综合课程。

但模型能力会不断变化,固定题库迟早会过期。上一轮还很困难的问题,训练之后可能迅速变成送分题。BigBang 真正要解决的,不只是「如何生成更多科学数据」,还得是如何让训练任务的生产系统,随着模型能力一起变化

BigBang 如何让「造题程序」自己进化?

BigBang 的技术框架包含内外两层循环。内层持续改进合成数据,外层验证这些数据能否真正提升模型

内层循环由 Generator Agent 和 Critic Agent 组成。前者持续生成并求解候选任务,后者负责对抗式审查。通过审查的样本进入训练数据池,存在缺陷的样本会被修改或淘汰。Critic 给出的反馈还会影响下一轮生成策略。



BigBang 整体框架。Generator Agent 持续更新数据合成策略并构造任务,Critic Agent 执行质量评估和约束检查,经过筛选的合成数据用于后训练 BigBang-V1。

Generator Agent并非只根据提示词批量生成题目,它以代码 Agent 的形式工作,可以直接修改、执行和调试数据合成程序,在任务构造、工具使用、答案验证和样本筛选等环节搜索更好的策略。

每轮实验结束后,生成器会记录修改动机、结果和失败原因,供后续轮次继承。系统优化的对象由单条样本扩展至整套数据生产程序。

Critic Agent承担快速评估。

理想情况下,每改变一次合成策略,团队都可以重新训练模型,再观察下游能力是否提高。这样的实验成本很高,反馈周期也很长。Critic 先估计一批数据的训练价值,为 Generator 提供更密集的优化信号。

它的审查分为两层。第一层检查基本约束,包括推理轨迹是否保留足够信息、工具调用是否有效、数据格式是否完整,以及样本能否被训练与执行系统正确解析。第二层检查更高阶的质量,包括关键结论有没有证据、不同步骤是否存在矛盾、最终答案能否客观验证,以及任务是否需要非平凡的研究和推理。

这套内层循环可以持续改进合成策略,却仍然存在一个风险。Critic 可能把「看起来很难」误判成「能够帮助模型进步」。一个任务拥有复杂叙述和很长的工具轨迹,不代表它具备真实训练价值。

BigBang 为此加入外层循环,用于校准这种偏差。

系统会选择不同版本的数据生产管线,使用其生成的数据分别训练模型,再将模型放到留出的真实研究任务中评测。

Meta-Critic比较两种信号。第一种是 Critic 对数据价值的预判,第二种是模型训练后的实际能力变化。如果一批数据得到很高评价,模型却没有在真实任务上进步,Critic 的标准和 Generator 的策略都需要调整。下一轮数据的领域分布、难度和能力要求也会重新配置。



BigBang 的两层共同演化框架。内部 Generator–Critic 循环负责快速生成和筛选可验证数据;外部真实任务评测检验数据效用,并反向校准 Critic 和下一轮合成策略。

如此一来就形成了一个完整飞轮。真实任务暴露能力缺口,Generator 生产针对性问题,Critic 过滤低价值样本,合成数据用于训练新模型,模型再回到真实任务接受检验。评测结果继续改变下一批数据的生产方式。

35B 跨越规模,BigBang 学到的不只是科学

实验结果怎么样呢?

BigBang-V1 后训练阶段使用约一万条 AI 合成数据。在 11 项评测中,它有 10 项超过基础模型,并在多项高难度任务上进入了更大模型所在的能力区间。

在 FrontierScience Research 上,BigBang-V1 获得 46.2 分,DeepSeek V4 Pro Preview 为 40.7 分;在 Humanity’s Last Exam 上,前者为 50.3 分,后者为 48.2 分;在 BioMysteryBench Human-Difficult 和 PaperBench(Code-Dev)上,BigBang-V1 也取得了更高成绩。



BigBang-V1 在涵盖长程搜索、软件工程、科学研究和 AI 研究的八项代表性基准上均取得优异表现。在选取的 35B 模型中,BigBang-V1 在全部八项基准上取得最高报告分数;在 FrontierScience Research、Humanity’s Last Exam、PaperBench(Code-Dev)和 BioMysteryBench-HD 上,它甚至超过了 DeepSeek V4 Pro Preview(1.6T)。

这些任务考察它能否完成检索、推理、代码执行和结果验证等连续工作。

BigBang-V1 的实验结果表明,在不扩大基础模型规模的情况下,改变后训练任务的生产方式,也可能明显拓展模型能力

而且,这种提升没有停留在科学评测中。

在开放网络长程检索任务 BrowseComp 上,BigBang-V1 取得 76.5 分;在真实软件工程评测 SWE-Bench Pro 上,它取得 54.2 分,均较基础模型明显提高。

如果训练只是让模型记住了更多科学知识,收益理应主要出现在科研任务中。搜索和代码能力同步增长,说明模型学到的更可能是一套跨领域的问题解决流程:寻找证据、提出假设、调用工具、检查结果,并根据失败调整路线。

团队给出的两个案例,更具体地展示了这种变化。

在 BioMysteryBench 的病毒识别任务中,模型需要分析三份肠道类器官样本的 FASTQ 文件,判断感染的 RNA 病毒。BigBang-V1 三次运行都将答案收敛到 Norovirus GII.4 或 Norovirus;作为对比,DeepSeek V4 Flash Preview 三次给出了三个不同的病毒类别。



这里的关键在于模型能否从噪声数据中建立稳定的证据链,并多次收敛到同一个可复查结论。

另一个案例是旋量范数椭圆积分任务。题目要求模型精确计算一个复杂的椭圆积分,明确禁止用数值积分或截断级数代替解析答案。

BigBang-V1 先找到一份公开的证明纲要,随后核验其中涉及的 Landen 变换、边界条件、参数变换和特殊值关系,最终给出只包含 Gamma 函数的闭式结果,并形成一条完整的推导与验证链。



DeepSeek V4 Pro Preview 也得到了正确结果,并通过最高约 200 位精度的数值计算确认其一致性。不过,它没有完成从原始积分到最终结果的解析推导,提交程序仍然依赖现成的椭圆积分函数。



旋量范数椭圆积分任务上的推理轨迹对比。两个模型都给出了正确结果。BigBang-V1 进一步完成了关键中间步骤的核验和完整解析推导;DeepSeek V4 Pro Preview 却没有完成从原始积分到特殊值的解析推导。

两者答案都正确,差距集中在证明过程的完整性和可审计性。对于高难度科学任务,模型既要找到结果,也要说明结果如何得到、关键步骤能否成立。

病毒识别和椭圆积分分属生物分析与符号数学两个领域,却体现了相通的能力,就是把复杂问题拆成可验证的步骤,从噪声中提取有效证据,并在检查后持续修正路径。

这也解释了科学训练为什么能够迁移到搜索和代码任务:模型在学习科学知识的同时,也反复练习了一套可以用于复杂问题的方法。

BigBang 进一步把合成数据从一次性样本,变成了一套能够持续调整策略的数据生产系统。

数据层自我进化,离完整 RSI 还有多远?

让 AI 参与训练数据生产,BigBang 并非先例。

Absolute Zero 让模型自主提出并解决可由代码执行器验证的数学与编程任务;Google DeepMind 的 AlphaEvolve 利用大模型生成程序,再通过自动评估器演化候选方案。

BigBang 的不同在于,将任务生成程序、任务分布和评价标准共同纳入优化范围,并用真实科研任务上的训练收益校准合成管线。优化对象由单个答案或程序,扩展至训练模型所需的课程系统。论文将其称为「数据层面的早期递归自我改进」。

完整 RSI 通常意味着 AI 能够自主改进研发能力,训练更强的继任模型,再由新模型推动下一轮升级。BigBang 目前展示的是数据管线与模型能力的共同演化,是这一路径上阶段性的可执行方案。

过去的 Scaling Law 主要关注参数、数据量和计算量,现在 BigBang 又提出了另一个值得关注的维度,即数据引擎提升自身任务生成与验证能力的速度。

模型越来越擅长回答已有问题后,竞争将继续深入问题的生产端。谁能持续找到下一道值得学习、足够困难、又能可靠验证的题,谁就更有机会把模型能力的增长延续下去。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国总统痛哭流涕,伊朗如果有能打到美国本土的导弹,美国国运休矣

美国总统痛哭流涕,伊朗如果有能打到美国本土的导弹,美国国运休矣

农夫史记
2026-08-06 20:53:18
野心配不上格局,一张旧照,道尽邹市明一家衰败的根源

野心配不上格局,一张旧照,道尽邹市明一家衰败的根源

东方不败然多多
2026-07-24 11:55:10
中超|北京国安主场4球零封深圳新鹏城,赛季首次升至积分榜第三

中超|北京国安主场4球零封深圳新鹏城,赛季首次升至积分榜第三

北青网-北京青年报
2026-08-07 22:32:04
张卫健当年霸屏的十部剧,收视率爆棚,你还记得几部?

张卫健当年霸屏的十部剧,收视率爆棚,你还记得几部?

小Q侃电影
2026-08-05 22:12:16
一年陪睡300次真相大白后,45岁张娜拉现状曝光,丝毫不感到意外

一年陪睡300次真相大白后,45岁张娜拉现状曝光,丝毫不感到意外

深析古今
2026-07-01 20:40:54
比失业更可怕的事,正在悄悄发生

比失业更可怕的事,正在悄悄发生

东亚财评V
2026-08-07 19:46:13
明星也开始“失业”,多位艺人自曝无戏可拍,有人早已另寻出路

明星也开始“失业”,多位艺人自曝无戏可拍,有人早已另寻出路

洲洲影视娱评
2026-08-07 13:35:01
菲律宾变了!一旦中菲开战,中国的这些岛礁恐怕真守不住了?

菲律宾变了!一旦中菲开战,中国的这些岛礁恐怕真守不住了?

无情有思可
2026-08-06 14:04:57
问题严重了,特朗普制裁中企后,中方还没出手,美国25州先出手了

问题严重了,特朗普制裁中企后,中方还没出手,美国25州先出手了

面包夹知识
2026-08-07 14:17:30
全体集合,下周的预测出来了!创新药强势,我来说两句!

全体集合,下周的预测出来了!创新药强势,我来说两句!

一担金
2026-08-07 13:18:16
广州市销量第一的汽车:几乎没有什么悬念,上半年销量达4513台

广州市销量第一的汽车:几乎没有什么悬念,上半年销量达4513台

柳先说
2026-08-07 18:56:35
王凯灵堂现场曝光!白花妆点「招牌灿笑照」暖哭众人 经纪人揭王妈妈现身安排

王凯灵堂现场曝光!白花妆点「招牌灿笑照」暖哭众人 经纪人揭王妈妈现身安排

ETtoday星光云
2026-08-07 13:11:06
邵逸夫离世前和挚友坦言:我手握两百亿资产却无子女愿意接手。我的四名孩子分毫不要,原因是其母亲过世时,我犯下难以弥补的过错

邵逸夫离世前和挚友坦言:我手握两百亿资产却无子女愿意接手。我的四名孩子分毫不要,原因是其母亲过世时,我犯下难以弥补的过错

唠叨说历史
2026-08-04 16:07:29
沙特、土耳其与巴基斯坦签署共同防务协议

沙特、土耳其与巴基斯坦签署共同防务协议

澎湃新闻
2026-08-07 19:23:17
小酒窝与爸爸高云翔合体,继承董璇优秀基因,往事如烟!

小酒窝与爸爸高云翔合体,继承董璇优秀基因,往事如烟!

小小一米月儿
2026-08-06 00:35:03
打不过就跑,这都什么毛病啊?

打不过就跑,这都什么毛病啊?

中国新闻周刊
2026-08-07 13:55:51
十年爱情长跑,荷兰弟如愿“嫁”给了赞达亚!成功追到梦中女神的还有他们……

十年爱情长跑,荷兰弟如愿“嫁”给了赞达亚!成功追到梦中女神的还有他们……

新民周刊
2026-08-07 14:16:43
森保一:日本从青训到国家队的培养体系,绝对没有输给世界

森保一:日本从青训到国家队的培养体系,绝对没有输给世界

懂球帝
2026-08-07 19:43:06
二婚搭伙19年的老伴去世后,他儿子给我转了35万,我以为是补偿

二婚搭伙19年的老伴去世后,他儿子给我转了35万,我以为是补偿

五元讲堂
2026-03-30 15:07:43
【中超】达万中两元张玉宁法比奥破门 国安4比0深圳

【中超】达万中两元张玉宁法比奥破门 国安4比0深圳

体坛周报
2026-08-07 21:46:14
2026-08-08 00:16:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13699文章数 142712关注度
往期回顾 全部

科技要闻

突然涨价,"只收电费钱"的梁文锋,变了吗

头条要闻

穆杰塔巴被指给总统下"最后警告" 爆料人发声意味深长

头条要闻

穆杰塔巴被指给总统下"最后警告" 爆料人发声意味深长

体育要闻

去年信誓旦旦3000万 今年NBA查无此人

娱乐要闻

周也热恋结束,六个字暴露单身状态

财经要闻

腾讯WorkBuddy领跑AI办公 阿里字节急了?

汽车要闻

越7全球首秀 传祺开始进攻方盒子越野

态度原创

旅游
家居
本地
公开课
军事航空

旅游要闻

焕新开园!深圳园博园多国主题花园免费开放,解锁园林新经济

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

课本里的童年,绍兴正上演

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

乌防空导弹严重短缺 泽连斯基公开喊话

无障碍浏览 进入关怀版