网易首页 > 网易号 > 正文 申请入驻

全球竞逐RSI,这支华人团队已跑通规模化闭环

0
分享至

10 月 6 日,OpenAI 公开了 AI 产出的 722 篇数学论文,包括准黎曼猜想的相关证明。前 Google 科学家、xAI 联合创始人 Christian Szegedy 表示,数学家穷尽一生攀登的险峰,机器可乘飞机直接抵达。但 Szegedy 认为,数学不是走向终结,而是探索方式的改变 —— 人们可以借助飞机,抵达更多未境之地,他自己对此兴奋不已。

这架飞机,能否继续飞向更广阔的科学与工程前沿 —— 从癌症机理、衰老干预,到尚无成熟路径的复杂工程难题?

全球 AI 实验室正将目光投向 RSI(递归自我改进):让 AI 不只完成任务,还能参与下一代 AI 的设计、训练与改进。这场系统性探索才刚刚开始,大多数探索尚处于早期。

而一支华人团队,已经把 RSI 带入了规模化运行。它打造的 Novix,将自我改进机制嵌入真实的前沿算法与工程任务,让 AI 在解决问题的过程中,持续吸收顶尖专家的判断与反馈,并将这些经验用于自身的下一轮改进。



官网链接:Novix.science

成立仅半年,Novix 通过口碑传播,已服务 20 万名专家,覆盖 40 多个国家和地区、500 多所高校及科研机构。用户中包括来自清华大学、北京大学、苏黎世联邦理工学院、剑桥大学、卡内基梅隆大学、南洋理工大学、新加坡国立大学和东京大学等机构的研究者。

不同学科和领域的实际研究已经在平台上展开:水坝群如何进行生态泄洪调度,钢材在未知地震加载下会有怎样的循环响应,低成本空气质量监测网络如何实现跨站点校准、城市干道协同控制、金融市场高频流动性建模,还有 AI 模型的后训练。

Novix 由石宇、汤嘉斌等人创立,核心成员来自 Google、微软、Meta、智谱和 Kimi,曾主导或参与 Microsoft Copilot、Kimi K2、AgentOS 和 AutoAgent 等项目。

这支华人团队为什么能率先把 RSI 推向全球规模化闭环?

答案在于,Novix 在产品、系统与算法层面,重新定义 AI 与人类顶智专家的协同进化关系。Novix 将这套机制称为 Co-Evolutionary RSI—— 协同进化式 RSI。

“机器负责加速边界的探索,人类把价值、审美和选择持续写进系统。” 石宇说。“两者共同组成一个持续运行、自我改进的智能进化系统。”

在这个回路里,AI 主动提出方向、展开解空间、执行任务并验证结果;专家持续反馈什么是重要的问题、什么证据足以成立、采用怎样的评价标准(rubrics),以及哪些方向符合自己的审美与长期判断。每一次采用、否决、纠偏和反馈,都会成为下一轮探索的新目标与新标准,并进一步改进系统的任务分解、工具使用、harness 与模型能力。

真实高难任务持续暴露系统的能力边界,专家反馈不断推动系统进化,进化后的 AI 再去解决更难的问题。Novix 规模化的,正是这个在前沿算法与工程领域中持续运行的 RSI 飞轮。

石宇说:“能真正把 RSI 做到规模化的,一定是最能杠杆人类顶尖专家审美的系统。”

让每位科学家都有自己的 AI 自主实验室

Novix 在与全球专家的持续协作中,学习每位研究者关注的问题、判断证据的方式与探索偏好,再主动提出候选方向并完成验证。科学家在关键节点选择继续、暂缓或纠偏,也可以重新定义评价标准;这些判断随即成为下一轮探索的起点。

把这种关系放进一个典型的材料研究场景:一位 PI 不必每天给系统写出完整任务,只需在候选方向中判断哪些值得推进、哪些证据不足、哪些异常值得追问;余下的探索、实验和验证由 AI 持续展开。随着判断不断积累,系统逐渐形成贴合这位研究者的探索路径。

为了探索那些连人类都尚未知晓答案的领域,最重要的是研究解空间中最值得推进的下一步。科学家的每一次选择,都在告诉系统什么是好问题、怎样判断证据、愿意承担怎样的风险,以及什么结果真正有价值。同一个基础模型,因此会沿着不同专家的 taste 生长出不同的探索路径。





不同领域的人机协同进化环境。在酶工程(图上)中,一个 “提高工业酶性能” 的目标,逐步变成关于突变组合、实际反应条件和实验取舍的具体问题;在离散扩散语言模型(图下)中,一个新型文本生成方向,逐步展开为训练、生成速度、推理能力等不同研究路线

汤嘉斌表示:“通用模型倾向于提出近似相同的问题分布,而人类专家的反馈才是决定 RSI 系统在探索人类未知时的种子变量。”

协作越久,任务分布、判断标准、失败记录和探索脉络越完整,最终沉淀为属于个人或实验室难以复制的研究资产和数据壁垒。这些数据保留在专属空间中,只服务于对应的用户或组织。

会做,正在成为 Agent 的标配;知道什么值得做,才是探索式智能的分水岭。Novix 不等待科学家交付一张完整的任务清单,而是持续发现、筛选并验证值得推进的下一步。

当 AI 把执行与验证的边际成本压到接近于零,决定研究上限的就不再是 “能试多少次”,而是 “知道什么值得试”。执行被无限放大,科学家的 taste 就成为智能进化的方向盘。

Novix 想要放大顶尖专家判断的作用半径。过去,这样的判断可能只能影响一名学生、一个项目或一次实验,如今被转化为持续驱动 AI 探索知识边界的系统变量。

团队产品合伙人施蓓提到 “衡量这套系统的尺度,不是一次完成多少任务,而是专家的一次判断能把探索推进多远。”

三个前沿任务中的 RSI 闭环

方向确定后,Novix 会组织多个 Agent 调度算力、处理数据、设计方法、搭建环境并运行训练或仿真。科学家不必介入每次工具调用,只在证据、标准或方向需要变化时介入。石宇把科学家一次判断所能支撑的探索方向的优化,称为 “人类审美的杠杆”。

前沿科研不是把既定任务一路跑到底:实验会推翻假设,新证据会迫使系统修改策略,局部指标的提升也可能让研究偏离真正的问题。“产品与系统机制的设计必须容纳这个过程。” 石宇说。

因此,Novix 把材料、目标、评价标准、工具调用、中间产物和失败记录保留在同一工作空间。研究者不必盯住每一步,却能在需要时追溯系统为什么修改参数、哪条路径失败、偏差从哪里出现。失败不是被清理的噪声,而是系统资产:它既告诉 Agent 哪条路走不通,也暴露工具、环境、评估器和模型还缺什么。

三个公开任务提供了更具体的观察窗口:训练模型、调度复杂基础设施、预测材料在未知工况下的响应。它们过去都高度依赖顶尖专家的持续参与。

让 AI 自主端到端完成模型后训练

这是 RSI 核心的一类任务:Agent 直接参与模型能力的训练与选择。Novix 自主完成数据构造、训练代码、SFT、GRPO 或 RFT、检查点比较与最终交付。在 SynLogic 的 135 道固定评测题上,Qwen2.5-7B 准确率从 8.89% 提升至 37.78%;在 ScienceWorld 的 30 项代表任务中,Qwen2.5-7B-Instruct 平均得分从 11.2667 提升至 35.6333。



过程中还有一次堪称 “神来之笔” 的判断:后续强化学习的训练 loss 仍在下降,Novix 却发现模型在真实任务探针中的得分从 38.7 跌至 21.1—— 模型只是更会拟合训练轨迹,却没有变得更会解决问题。Novix 主动否决了这次更新,恢复并交付表现更好的模型。AI for AI 最关键的能力,不是让每一轮训练都继续,而是判断模型是否真的变得更聪明,并在必要时停止、回退和重新选择进化方向。



更重要的是,这些训练任务不只改进被训练的模型。数据、日志、失败路径与评测结果也会回流 Novix,用于改进它自身的任务分解、工具选择、评估器和模型,由此形成 AI for AI 的递归闭环。

在多约束情况下求解联邦水坝耦合控制

在一项基于真实河流记录的泄洪调度模拟任务中,Novix 需要为哥伦比亚河与斯内克河上的八座水坝逐小时分配泄洪量。泄洪能帮助幼鱼绕开发电机组,却会抬高水中的总溶解气体,带来生态风险;上游的调整还会延迟影响下游。

在约 3.57 小时的有效用时内,Novix 完成了 578 次工具调用,反复数据处理、算法开发、运行实验,并根据反馈持续修正预测与控制策略。它发现一处气体传播时距被错误设为 44 小时,重新推导后将其修正为 16 小时;还发现,预测误差降低并不必然改善调度效果,于是放弃跨季节表现不稳定的方案,转而根据预测误差对调度成本的影响重新设计优化目标。候选方案形成后,验证仍在继续 —— 它不仅检查预测是否准确,还检验这些预测能否带来更好的决策。



Novix 在发电要求、气体上限和复杂运行规则之间,找到八座水坝协同运行的控制策略。

最终,Novix 在研究期间不可见的 16 个独立测试周中取得 0.719264 的得分,较题方专家参考方案高出 6.50%,所有控制指令均通过执行约束检查。它交付的不是一份泛泛的调度建议,而是一套能够逐坝、逐小时输出决策的可执行控制器。这个案例展示了 Novix 如何通过持续调用工具、纠正预测和调整策略,把一个复杂问题推进到经过验证、可以运行的结果。

预测钢材在未知地震加载下的循环响应

地震发生时,钢结构会反复承受拉伸和压缩。要预测它在这样的过程中如何变形,不能只看某一次受力:此前经历了什么,也会影响材料接下来的表现。因此,从已有试验中建立的模型,能否适用于另一种受力过程,是材料研究中需要检验的问题。

Novix 从已有拉伸和循环试验出发,自主提出本构假设、修改数值实现并反复验证。在 60 个研究期间不可见的加载历程上,它取得 0.620034 的题方保留测试得分,约为专家参考解 0.310910 的 1.99 倍,所有实例均返回有效结果。





60 个实例全部生成有效结果,且全部超过基础方案。证明 Novix 能够从有限的既有试验中提出本构假设、构建模型、完成参数标定,再把获得的材料规律迁移到从未见过的加载路径上

这些任务的共同点在于,答案无法一次生成,必须在实验、失败和评价中不断收敛。

而每一次收敛留下的数据、失败路径与专家判断,都会回流系统,成为下一轮探索的起点。这也正是 RSI 闭环在真实任务中的样子。

更强智能时代的人机关系

石宇曾在微软参与 Microsoft Copilot 从零到亿级用户的增长,并作为 MS AgentOS 创始产品经理推进前沿 AI 产品化。汤嘉斌拥有香港大学博士学位,曾参与 Kimi K2 后训练,并主导 AutoAgent 和 AI-researcher 开源项目。

团队其他成员包括来自 Meta、微软的算法研究人员,以及具有 Google、微软和 Amazon 产品经验的成员,覆盖模型后训练、Agent 系统、基础设施与产品设计。这组背景也解释了 Novix 团队为什么会把模型改进、Agent 系统和用户长期协作视为同一个问题。

他们在实践中愈发感到,顶级专家不是一份等待 AI 提取完毕的静态知识库。他会被新证据说服,会对意外结果产生兴趣,也会放弃过去坚持的解释。AI 带回的新发现会改变人的判断,人的新判断又会改变 AI 的下一轮探索。Co-Evolution 让双方在不断出现的新问题中共同进化。

即便 Agent 有一天超越人类既有的智力边界,这种协同仍会继续产生价值。开放式任务的方向会在真实任务、专家反馈和新的科学发现中不断演化;越多具有不同 taste 的专家进入回路,系统获得的目标、标准和现实约束就越丰富,能够抵达的知识边界也越广。

更强的基础模型会抬高所有人的能力下限,却不会抹平不同研究者的问题意识。通用能力决定 AI 能做多少事,长期协作形成的 taste 决定这些能力被用于什么问题。两条能力轴线相互正交:基础模型越强,个体化探索引擎的分化价值反而越大。

RSI 越向前发展,人类最稀缺的判断越会成为智能递归的关键变量。

Novix 已经把这场 Co-evolution 做成了一座每个科学家都能拥有的 AI 自主实验室。在这里,AI 不知疲倦地展开探索,科学家不断收获研究成果,用并自己的 taste 决定什么值得进入下一轮研究。

这也是 Novix 正在验证的协同进化 RSI 路径 ——AI 探索未知,人类选择未来。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
10年跌9成产量!中国葡萄酒死磕“又酸又涩”,终被消费者抛弃?

10年跌9成产量!中国葡萄酒死磕“又酸又涩”,终被消费者抛弃?

阿振观点
2026-08-23 05:37:52
跌光3500亿,啤酒之王崩了

跌光3500亿,啤酒之王崩了

投资家
2026-10-09 21:36:44
尊界刹车踏板事件,为什么闹这么大

尊界刹车踏板事件,为什么闹这么大

功夫财经
2026-10-09 07:13:32
王平河:江湖再见(3/9)

王平河:江湖再见(3/9)

金昔
2026-10-09 23:44:34
无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

梦史
2026-08-29 06:21:20
邵佳一最大败笔!刘祝润中超再破门:已独造9球,刚落选上期国足

邵佳一最大败笔!刘祝润中超再破门:已独造9球,刚落选上期国足

邱泽云
2026-10-09 22:57:34
篮协的当务之急不是什么“总结”,而是要趁热打铁,打掉所谓的铁帅和铁打的营盘

篮协的当务之急不是什么“总结”,而是要趁热打铁,打掉所谓的铁帅和铁打的营盘

英雄稚气
2026-10-08 21:25:41
日本诺奖再添一人,25年兑现一个“狂言”

日本诺奖再添一人,25年兑现一个“狂言”

难得君
2026-10-07 19:19:17
现在轮到银行发愁了?越来越多储户,主动把存款分散到不同银行

现在轮到银行发愁了?越来越多储户,主动把存款分散到不同银行

陈腕特色体育解说
2026-10-09 04:14:39
法国总统候选人公开表示:台湾是中国的一部分,如果我当选法国总统,绝不会让法国因为台湾问题而卷入战争

法国总统候选人公开表示:台湾是中国的一部分,如果我当选法国总统,绝不会让法国因为台湾问题而卷入战争

吉刻新闻
2026-10-09 18:35:28
世纪审判敲定!国际刑事法院裁定杜特尔特无权保释,11月受审

世纪审判敲定!国际刑事法院裁定杜特尔特无权保释,11月受审

明天见灌装冰块
2026-10-09 15:19:12
圣母心泛滥!情侣差点闹掰:女生免费送人70元牛肉面,男友指责其不懂做生意发飙了

圣母心泛滥!情侣差点闹掰:女生免费送人70元牛肉面,男友指责其不懂做生意发飙了

火山詩话
2026-08-26 11:01:13
人工湖清淤,湖底捞出12辆共享单车,车上都绑着一具人形模特

人工湖清淤,湖底捞出12辆共享单车,车上都绑着一具人形模特

罪案洞察者
2025-11-26 13:42:51
伊朗阿曼就霍尔木兹海峡安全通道坐标达成一致

伊朗阿曼就霍尔木兹海峡安全通道坐标达成一致

新华社
2026-10-08 16:17:07
直接挂断诺奖来电!新科诺贝尔文学奖得主:今天只是平常的一天

直接挂断诺奖来电!新科诺贝尔文学奖得主:今天只是平常的一天

颤抖的熊猫
2026-10-09 13:02:16
中日联合声明承诺台湾问题,高市早苗却扬言动武,想要撕毁承诺?

中日联合声明承诺台湾问题,高市早苗却扬言动武,想要撕毁承诺?

观锐器
2026-10-08 15:33:15
深圳市委、市政府决定:给予吴龙同志追记二等功

深圳市委、市政府决定:给予吴龙同志追记二等功

政知新媒体
2026-10-09 11:53:02
明日九月初一,讲究:1要送,2不见,3不剩,4要吃,为家人祈福,寓意吉祥美满,兴旺富足,安康度秋

明日九月初一,讲究:1要送,2不见,3不剩,4要吃,为家人祈福,寓意吉祥美满,兴旺富足,安康度秋

小茉莉美食记
2026-10-09 12:16:27
没想到还有皮肤这么白的女子,随便轻轻磕碰一下都会留下印子吧

没想到还有皮肤这么白的女子,随便轻轻磕碰一下都会留下印子吧

娱你同欢
2026-10-08 21:45:42
iPhone 18 Pro系列国内激活量超300万台 Pro Max单周破76万

iPhone 18 Pro系列国内激活量超300万台 Pro Max单周破76万

CNMO科技
2026-10-09 17:43:06
2026-10-10 01:39:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14163文章数 142748关注度
往期回顾 全部

科技要闻

华为小米手机同日涨价,最高涨1000元

头条要闻

七旬大伯在浙江买山景别墅养老 住进去后天天提心吊胆

头条要闻

七旬大伯在浙江买山景别墅养老 住进去后天天提心吊胆

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

时隔12年,公募基金运作办法修订

汽车要闻

2027款深蓝L06及追风版上市 限时权益价11.49万元起

态度原创

教育
旅游
家居
公开课
军事航空

教育要闻

中学要求家长到校轮值延时晚自习,“必须是学生父母”;校方:自愿参加;当地教育局做出回应

旅游要闻

贵州新晋赏花天花板!娄山关四季花海,避暑遛娃一站式拿捏

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

直击南部战区海军某部重装空投训练

无障碍浏览 进入关怀版