网易首页 > 网易号 > 正文 申请入驻

35B干赢万亿参数大模型!上交大AI开始给自己造题还能自我迭代了

0
分享至

编辑|+0、杨文

AI 开始参与造 AI,下一步学什么成了新问题。

Ilya Sutskever 去年底指出,预训练数据终将耗尽,单纯把现有训练规模再放大 100 倍,很难带来根本性变化。经历数年的规模扩张后,AI 行业正在重新进入「研究时代」,下一次能力跃迁需要新的训练方法和学习机制。

行业的注意力也开始转向研究流程本身。昨天,在谷歌效力 27 年的技术元老 Jeff Dean 官宣离职,拉着 Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals 三位老伙计共同创办 Discovery Loop。而这家公司干的,就是自动化科学与工程中的完整实验循环,让 AI 提出实验、完成实现、运行评估,再根据结果调整下一步方向。



那么问题来了,当模型越来越擅长解决问题,下一批真正有价值、足够困难的问题该由谁提出?这些问题的答案又该如何可靠验证?

来自上海交通大学人工智能学院、深势科技和上海算法创新研究院的无尽前沿团队,最近给出的思路是让 AI 参与创建、筛选和迭代自己的训练任务,并由此发布科研大模型 BigBang-V1



  • 模型:https://huggingface.co/endless-frontier/BigBang-v1
  • 项目主页:https://endlessfrontier.tech/
  • 论文标题:BigBang: Pursuing Open-Ended Intelligence through Self-Evolving Synthesis of Verifiable Frontier Tasks
  • 完整技术报告:https://endlessfrontier.tech/assets/paper.pdf

BigBang-V1 基于 Qwen3.6-35B-A3B 进行后训练,在后训练阶段使用了完全由 AI 合成的数据。实验结果显示,在所选 35B 规模模型中,BigBang-V1 在 10 项评测上取得最高已报告分数,并在若干高难度任务上达到或超过部分更大规模的前沿模型。



BigBang-V1 与代表性闭源、开源前沿模型及 35B 参数规模模型在长程搜索、编程、科学研究和 AI 研究基准上的对比。“-” 表示相关分数尚未公开或未经测试。

又一次「小模型挑战大模型」的叙事?并非如此,BigBang-V1 的真正亮点是它背后的数据生产方式。

在传统流程中,人类专家确定方向、设计问题、准备答案并检查结果,模型负责学习已经整理好的数据。BigBang 则试图把其中更多工作交给 AI,它不仅生成问题和答案,还参与修改数据生产程序、调用工具完成任务、检查候选结果,并根据数据是否切实提升了模型能力调整下一轮合成策略。

过去,AI 主要是被出题、被训练、被考试,BigBang-V1 则让 AI 开始参与决定下一代模型应该学习什么

模型越来越强,人类开始出不动题了

Scaling Law 大家已经耳熟能详,增加参数、投入更多算力、收集更多数据,模型能力通常也会随规模增长而提升。

过去几轮模型能力的跃迁,几乎都可以从参数、算力和数据的扩张中找到解释。久而久之,「更大」也就成了「更强」的同义词。

但模型也不能只依靠现有数据持续扩张,随着高质量数据和有效任务被反复使用,继续增加投入所带来的边际收益也会逐渐下降。

尤其当模型开始接近人类专家在部分任务上的水平,下一批真正能让模型继续进步的训练任务,要从哪里来

这和「互联网上还有多少文本」并不是一回事。

网上的数据当然还有很多,但具备训练价值的新任务未必充足。模型已经反复见过的知识,再学十遍也难以扩展能力边界。真正困难的是,如何持续提出模型还不会、又值得学习的问题。

这类问题通常需要专业研究人员来设计、求解和验证。GPU 可以采购,专家时间却很难按卡扩容。大模型几天就能消耗掉海量数据,人类专家却无法突然进入倍速模式。哪怕一天喝三杯咖啡,也很难跟上计算集群的数据胃口。

更准确地说,模型缺的不只是题,而是「题目加反馈」。

一道题足够难却无法判断答案对错,很难形成稳定的训练信号;一道题容易验证却低于模型当前能力水平,训练价值同样有限。

真正适合持续训练的任务,需要同时满足两个条件:足够前沿,也能够验证。前沿性决定模型能否学到新东西,可验证性决定它学到的是不是对的。

BigBang 把科学研究选作了这两个条件的交汇点。

科学会不断产生新问题,同时提供形式化证明、程序执行、数值计算、模拟器、数据库、实验反馈和领域规则等多种验证手段。模型的答案可以直接放进工具里跑一遍,不必只靠另一个模型来评判。

更重要的是,解决一个完整的科学问题,往往需要搜索资料、判断证据、提出假设、编写代码、调用工具、分析结果,并在失败后调整路线。科学因此成为训练通用问题解决能力的综合课程。

但模型能力会不断变化,固定题库迟早会过期。上一轮还很困难的问题,训练之后可能迅速变成送分题。BigBang 真正要解决的,不只是「如何生成更多科学数据」,还得是如何让训练任务的生产系统,随着模型能力一起变化

BigBang 如何让「造题程序」自己进化?

BigBang 的技术框架包含内外两层循环。内层持续改进合成数据,外层验证这些数据能否真正提升模型

内层循环由 Generator Agent 和 Critic Agent 组成。前者持续生成并求解候选任务,后者负责对抗式审查。通过审查的样本进入训练数据池,存在缺陷的样本会被修改或淘汰。Critic 给出的反馈还会影响下一轮生成策略。



BigBang 整体框架。Generator Agent 持续更新数据合成策略并构造任务,Critic Agent 执行质量评估和约束检查,经过筛选的合成数据用于后训练 BigBang-V1。

Generator Agent并非只根据提示词批量生成题目,它以代码 Agent 的形式工作,可以直接修改、执行和调试数据合成程序,在任务构造、工具使用、答案验证和样本筛选等环节搜索更好的策略。

每轮实验结束后,生成器会记录修改动机、结果和失败原因,供后续轮次继承。系统优化的对象由单条样本扩展至整套数据生产程序。

Critic Agent承担快速评估。

理想情况下,每改变一次合成策略,团队都可以重新训练模型,再观察下游能力是否提高。这样的实验成本很高,反馈周期也很长。Critic 先估计一批数据的训练价值,为 Generator 提供更密集的优化信号。

它的审查分为两层。第一层检查基本约束,包括推理轨迹是否保留足够信息、工具调用是否有效、数据格式是否完整,以及样本能否被训练与执行系统正确解析。第二层检查更高阶的质量,包括关键结论有没有证据、不同步骤是否存在矛盾、最终答案能否客观验证,以及任务是否需要非平凡的研究和推理。

这套内层循环可以持续改进合成策略,却仍然存在一个风险。Critic 可能把「看起来很难」误判成「能够帮助模型进步」。一个任务拥有复杂叙述和很长的工具轨迹,不代表它具备真实训练价值。

BigBang 为此加入外层循环,用于校准这种偏差。

系统会选择不同版本的数据生产管线,使用其生成的数据分别训练模型,再将模型放到留出的真实研究任务中评测。

Meta-Critic比较两种信号。第一种是 Critic 对数据价值的预判,第二种是模型训练后的实际能力变化。如果一批数据得到很高评价,模型却没有在真实任务上进步,Critic 的标准和 Generator 的策略都需要调整。下一轮数据的领域分布、难度和能力要求也会重新配置。



BigBang 的两层共同演化框架。内部 Generator–Critic 循环负责快速生成和筛选可验证数据;外部真实任务评测检验数据效用,并反向校准 Critic 和下一轮合成策略。

如此一来就形成了一个完整飞轮。真实任务暴露能力缺口,Generator 生产针对性问题,Critic 过滤低价值样本,合成数据用于训练新模型,模型再回到真实任务接受检验。评测结果继续改变下一批数据的生产方式。

35B 跨越规模,BigBang 学到的不只是科学

实验结果怎么样呢?

BigBang-V1 后训练阶段使用约一万条 AI 合成数据。在 11 项评测中,它有 10 项超过基础模型,并在多项高难度任务上进入了更大模型所在的能力区间。

在 FrontierScience Research 上,BigBang-V1 获得 46.2 分,DeepSeek V4 Pro Preview 为 40.7 分;在 Humanity’s Last Exam 上,前者为 50.3 分,后者为 48.2 分;在 BioMysteryBench Human-Difficult 和 PaperBench(Code-Dev)上,BigBang-V1 也取得了更高成绩。



BigBang-V1 在涵盖长程搜索、软件工程、科学研究和 AI 研究的八项代表性基准上均取得优异表现。在选取的 35B 模型中,BigBang-V1 在全部八项基准上取得最高报告分数;在 FrontierScience Research、Humanity’s Last Exam、PaperBench(Code-Dev)和 BioMysteryBench-HD 上,它甚至超过了 DeepSeek V4 Pro Preview(1.6T)。

这些任务考察它能否完成检索、推理、代码执行和结果验证等连续工作。

BigBang-V1 的实验结果表明,在不扩大基础模型规模的情况下,改变后训练任务的生产方式,也可能明显拓展模型能力

而且,这种提升没有停留在科学评测中。

在开放网络长程检索任务 BrowseComp 上,BigBang-V1 取得 76.5 分;在真实软件工程评测 SWE-Bench Pro 上,它取得 54.2 分,均较基础模型明显提高。

如果训练只是让模型记住了更多科学知识,收益理应主要出现在科研任务中。搜索和代码能力同步增长,说明模型学到的更可能是一套跨领域的问题解决流程:寻找证据、提出假设、调用工具、检查结果,并根据失败调整路线。

团队给出的两个案例,更具体地展示了这种变化。

在 BioMysteryBench 的病毒识别任务中,模型需要分析三份肠道类器官样本的 FASTQ 文件,判断感染的 RNA 病毒。BigBang-V1 三次运行都将答案收敛到 Norovirus GII.4 或 Norovirus;作为对比,DeepSeek V4 Flash Preview 三次给出了三个不同的病毒类别。



这里的关键在于模型能否从噪声数据中建立稳定的证据链,并多次收敛到同一个可复查结论。

另一个案例是旋量范数椭圆积分任务。题目要求模型精确计算一个复杂的椭圆积分,明确禁止用数值积分或截断级数代替解析答案。

BigBang-V1 先找到一份公开的证明纲要,随后核验其中涉及的 Landen 变换、边界条件、参数变换和特殊值关系,最终给出只包含 Gamma 函数的闭式结果,并形成一条完整的推导与验证链。



DeepSeek V4 Pro Preview 也得到了正确结果,并通过最高约 200 位精度的数值计算确认其一致性。不过,它没有完成从原始积分到最终结果的解析推导,提交程序仍然依赖现成的椭圆积分函数。



旋量范数椭圆积分任务上的推理轨迹对比。两个模型都给出了正确结果。BigBang-V1 进一步完成了关键中间步骤的核验和完整解析推导;DeepSeek V4 Pro Preview 却没有完成从原始积分到特殊值的解析推导。

两者答案都正确,差距集中在证明过程的完整性和可审计性。对于高难度科学任务,模型既要找到结果,也要说明结果如何得到、关键步骤能否成立。

病毒识别和椭圆积分分属生物分析与符号数学两个领域,却体现了相通的能力,就是把复杂问题拆成可验证的步骤,从噪声中提取有效证据,并在检查后持续修正路径。

这也解释了科学训练为什么能够迁移到搜索和代码任务:模型在学习科学知识的同时,也反复练习了一套可以用于复杂问题的方法。

BigBang 进一步把合成数据从一次性样本,变成了一套能够持续调整策略的数据生产系统。

数据层自我进化,离完整 RSI 还有多远?

让 AI 参与训练数据生产,BigBang 并非先例。

Absolute Zero 让模型自主提出并解决可由代码执行器验证的数学与编程任务;Google DeepMind 的 AlphaEvolve 利用大模型生成程序,再通过自动评估器演化候选方案。

BigBang 的不同在于,将任务生成程序、任务分布和评价标准共同纳入优化范围,并用真实科研任务上的训练收益校准合成管线。优化对象由单个答案或程序,扩展至训练模型所需的课程系统。论文将其称为「数据层面的早期递归自我改进」。

完整 RSI 通常意味着 AI 能够自主改进研发能力,训练更强的继任模型,再由新模型推动下一轮升级。BigBang 目前展示的是数据管线与模型能力的共同演化,是这一路径上阶段性的可执行方案。

过去的 Scaling Law 主要关注参数、数据量和计算量,现在 BigBang 又提出了另一个值得关注的维度,即数据引擎提升自身任务生成与验证能力的速度。

模型越来越擅长回答已有问题后,竞争将继续深入问题的生产端。谁能持续找到下一道值得学习、足够困难、又能可靠验证的题,谁就更有机会把模型能力的增长延续下去。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
那些整天喊着东大超越美帝的人进来看看!

那些整天喊着东大超越美帝的人进来看看!

廖保平
2026-09-30 08:27:34
中方收到通知,除图们江大桥外,新增跨境铁路,普京打一手好算盘

中方收到通知,除图们江大桥外,新增跨境铁路,普京打一手好算盘

为了更好
2026-09-14 04:45:39
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
2-0!巴萨飞翼2场2球,贝林厄姆遭遇神扑,英格兰知耻后勇

2-0!巴萨飞翼2场2球,贝林厄姆遭遇神扑,英格兰知耻后勇

我的护球最独特
2026-09-30 04:51:30
陈妤颉霸气和汶颂兑子,成史上最年轻亚洲短跑女皇,剑指亚运MVP

陈妤颉霸气和汶颂兑子,成史上最年轻亚洲短跑女皇,剑指亚运MVP

杨华评论
2026-09-29 21:17:32
“这就是不玩手机的下场”,家长拍下初中女孩幼稚行为,还沾沾自喜

“这就是不玩手机的下场”,家长拍下初中女孩幼稚行为,还沾沾自喜

世界圈
2026-09-29 08:53:23
63岁刘欢不幸辞世,最悲痛的不是他的妻子和女儿,是他41岁的徒弟

63岁刘欢不幸辞世,最悲痛的不是他的妻子和女儿,是他41岁的徒弟

悦君兮君不知
2026-09-29 06:47:57
2026事业单位改革收官:参公、薪级、车补同步调整,3类职工两难

2026事业单位改革收官:参公、薪级、车补同步调整,3类职工两难

职场资深秘书
2026-09-30 10:00:50
吃完饭就躺着容易生病吗?医生:不仅不长胖,可能还有2个好处

吃完饭就躺着容易生病吗?医生:不仅不长胖,可能还有2个好处

健康之光
2026-09-08 17:57:25
生育大局定了?如果没有意外,中国人口2027年起可能迎来3大变化

生育大局定了?如果没有意外,中国人口2027年起可能迎来3大变化

和海看日出
2026-09-14 23:12:57
早上起床后有这3种表现,说明身体很健康,中1个也不错

早上起床后有这3种表现,说明身体很健康,中1个也不错

奇妙的本草
2026-09-29 12:14:51
“你是网红孩子,全班都得迁就你?”家长吐槽女儿落选,网友急了

“你是网红孩子,全班都得迁就你?”家长吐槽女儿落选,网友急了

泽泽先生
2026-09-29 12:32:38
何猷君奚梦瑶婚礼答谢宴,何超琼何超凤坐梁安琪旁边,何超盈也在

何猷君奚梦瑶婚礼答谢宴,何超琼何超凤坐梁安琪旁边,何超盈也在

悠悠说世界
2026-09-29 11:05:11
美国记者彻底破防:中国农妇殷玉珍,才是全世界最伟大的超级英雄

美国记者彻底破防:中国农妇殷玉珍,才是全世界最伟大的超级英雄

历史点行
2026-08-26 18:15:05
大众新车官宣:9月30日,即将上市

大众新车官宣:9月30日,即将上市

手机讲坛
2026-09-30 01:22:38
许嵩冯禧婚后首现身,手挽手逛街,冯禧衣着宽松

许嵩冯禧婚后首现身,手挽手逛街,冯禧衣着宽松

韩小娱
2026-09-30 10:45:31
泰国真的不能再去了?无数游客亲身经历,坦言当地早已不复当年

泰国真的不能再去了?无数游客亲身经历,坦言当地早已不复当年

网络易不易
2026-09-30 06:10:17
科学家警告:厄尔尼诺现象可能很快会变得致命,前所未有转折点

科学家警告:厄尔尼诺现象可能很快会变得致命,前所未有转折点

铭记历史呀
2026-09-30 04:58:28
国际油价大幅收跌,美油跌破90美元关口

国际油价大幅收跌,美油跌破90美元关口

每日经济新闻
2026-09-30 07:30:43
马卡:皇马无视维尼修斯被替身阴谋论

马卡:皇马无视维尼修斯被替身阴谋论

懂球帝
2026-09-29 16:27:08
2026-09-30 11:23:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14107文章数 142740关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

媒体:菲方新海图包含南海多岛 可否把日本列岛也划入

头条要闻

媒体:菲方新海图包含南海多岛 可否把日本列岛也划入

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

金鹰这夜,演员争辉,有惊喜,反差

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

5.1米大车跑云南盘山路,海狮08试驾体验超预期

态度原创

游戏
本地
旅游
时尚
公开课

PS6别急着来了?前PS老大:先让PS5多活几年

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

旅游要闻

人海·微光丨不只面朝黄土 更能仰望星空

老板,我的脑子好像忘在家里了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版