网易首页 > 网易号 > 正文 申请入驻

本周AI项目推荐|Mirendil、INT21、rekursiv.ai ……最热门RSI 公司都在“自我改进”什么

0
分享至


作者樊雅婷
微信 FFF111f__

RSI(Recursive Self-Improvement,递归自我改进)是今年 AI 创业里最密集的一个方向。

3 月,参与过 o1、o3 和 GPT-4 的 Jerry Tworek 创立 Core Automation;5 月,Richard Socher、Jeff Clune 等八位研究者组建 Recursive;随后 Mirendil、INT21、rekursiv.ai、Inherent 相继公开;8 月,Jeff Dean、Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 成立 Discovery Loop。半年之内,这些公司融资合计超过 10 亿美元,其中仅Recursive 一家的估值就有46.5 亿美元。

它们用的词不一样:self-improving AI、self-accelerating AI R&D、continual learning、AI Scientist。描述的是同一个愿景:让 AI 参与改进 AI。

如果说RSI 最严格的定义,只有一句话:AI 改进“制造下一代 AI”的方法,下一代继承了这个改进,于是能做出更好的下下代。

关键不在某一次实验跑得多好,而在改进能不能传下去。所以,按这个标准,目前没有一家公司做到。宽泛的用法把模型自我纠错、持续后训练、自动跑实验、优化 Agent 的外围工具链(Harness,模型之外负责调度、记忆、工具调用的那层软件)都叫 RSI。但按这个标准的话,那么所有做 Agent 的公司都在做 RSI。

两个标准都不好用。我们换了一种方法:不管叫什么,AI 改进 AI 都可以拆成四步,提出一个改法、执行、验证是不是真的变好了、把变好的部分保留到下一轮。七家公司的差别,是三个问题的不同答案:AI 接管了哪几步;验证信号从哪里来、有多硬;保留的改进是只在这一轮有效,还是能被下一代继承。

第二个问题最关键。能自己跑实验的系统,最大风险是给自己打高分。验证信号不够硬,系统跑得越快,积累的错误越多。

本期项目推荐就按验证信号从最硬到最软来进行梳理。

1

一、反馈来自硬件计时:INT21

1. INT21:https://int21.ai


创始人 Bing Xu 是 GAN 原始论文共同作者,此前创办的 GPU 推理公司 HippoML 被 NVIDIA 收购,在 NVIDIA 做过一段 Distinguished Engineer,2026 年 4 月创业。

INT21 让 AI 写运行 AI 的底层代码。大模型在 GPU 上的每一个数学操作(矩阵乘法、归一化、注意力)都要翻译成 GPU 直接执行的一小段程序,这就是 Kernel。同一个操作,Kernel 写得好坏能差几倍速度,而会写 Kernel 的人极少。

产品 PTX Kernel Factory 的流程:用户定义操作、正确性要求、目标硬件和性能指标,系统调度多个 Agent 生成候选实现,编译、测试、测速,淘汰错的、保留快的,把成功和失败的记录带入下一轮。每一环都能在真实 GPU 上测出来。

公司开源了四个 Kernel(KDA 和 RMSNorm 各在 B200、H100 上一版),附测试方法和环境。公布结果里,Kimi Delta Attention 在 GH200 上达到专家手写版本的 1.24 至 1.59 倍,B200 上 1.42 至 1.52 倍;RMSNorm 在 GH200 的 11 个前向测试中几何平均快 8.17%,B200 的 126 个可比案例全部领先。INT21 同时公开了两个轻微回退案例,并说明这些数字只对应单个算子,不能换算成整个模型的加速。

INT21 的优势全部来自评估器。思路接近芯片设计里的 EDA:把工程目标写成机器能检查的约束,让软件搜索人类穷举不了的空间。硬件计时是一把不会被说服的尺子,近期一项 RSI 综述也发现,已展示的自我改进强度和验证信号强度直接相关,可执行测试是最可靠的一类。

INT21 目前更像一套出色的自动调优系统,还没表现出能改“怎么搜索”本身。

接下来值得关注的是:四个 Kernel 能否变成稳定管线;一次任务的经验能否让系统更快解决新算子、新硬件;算子级加速进入完整模型后还剩多少。

1

二、反馈来自 Benchmark,AI 开始选假设:rekursiv.ai 与 Inherent

这一层的产品都叫 AI Scientist:像研究员一样读论文、提假设、写代码、跑实验、看结果、决定下一步。和 INT21 的区别是,目标函数仍是人给的,但“验证哪个假设”开始交给 AI。

2. rekursiv.ai:https://rekursiv.ai/


创始人 Joshua V. Dillon 和 Dan Kondratyuk 都来自 Google/DeepMind 和 Luma AI。Dillon 是 TensorFlow Probability 主要创建者之一,参与过 Gemini、VideoPoet 和 Veo 早期工作;Kondratyuk 是 VideoPoet 第一作者。公司入选 YC S26,团队不大。

产品被称为“自动研究的驾驶舱”:研究者给出问题,系统调度多名 AI Scientist 并行建立假设、写代码、跑实验、维护排行榜,每条结论都能追溯到原始实验记录。

2026 年 7 月的 ARC-AGI 项目是它最具体的案例。ARC-AGI 是目前最难的推理测试之一,题目是人类容易看出、模型很难掌握的抽象图形变换规律。系统在几天内跑了 235 次完整实验、15 条主要方向,7 条带来可保留的提升。单模型 ARC-AGI-1 从 44.9% 提高到 71.4%,五模型集成 75.5%;迁移到 ARC-AGI-2 得到 17.5%。公司也公开了一次失败:一个训练出来的 Verifier(判断答案对错的模型)在训练集上大幅改善,换到评估集反而下降 2 个百分点。

最终分数并不是这个案例最有价值的部分。8 个没带来改善的方向,系统怎么处理,才反映它有没有参与研究判断:能否解释失败、及时止损、据此调整下一轮。

这套能力目前被关在 ARC 的边界内。任务是人定的,指标是现成的,系统也还没在半私有测试集上提交过成绩。在公开测试集上跑 235 次实验,过拟合风险很实在。真正的科研很少有随时可查的排行榜,当指标本身需要重新设计时,才是 rekursiv.ai 的考验。

3. Inherent:https://inherentlabs.ai


创始人 Tantum Collins、Edward Hughes、Louis Kirsch、Kaloyan Aleksiev,经历覆盖 AI Scientist、AlphaProof、Genie 和自动化 AI 研究。总部伦敦,Public Benefit Corporation,2026 年公布 5000 万美元种子轮,Index Ventures 和 Radical Ventures 领投。

Inherent 把概念叫 Recursive Collective Self-Improvement:改进对象是整间实验室,开会方式、算力分配、人何时介入、组织怎么从每次实验里学习。

最具体的成果是 Faraday,一个 27B 参数的 AI Scientist,本身不大,但能调用更大的 Coding Agent 作为工具,完成机器学习和 AI for Science 的论文复现。训练环境 Replica 从 100 篇论文生成 310 个“复现这张图表”的任务,242 个训练、68 个测试,每项限时 60 分钟、只给 H200 的一小块算力。Faraday 在 73% 的同分布任务和 60% 的 AI for Science 留出任务上优于对照 Agent,平均分比 Claude Opus 4.8 和 GPT-5.5 分别高 6% 和 8%。

“优于”的判定方式挺有趣,先用 Claude Opus 4.7 生成评分标准,再用 Codex GPT-5.5 打分,另外收集 20 名专家的 117 组排序,检查 AI 评分和人类判断的一致程度。AI 给 AI 打分、少量人类校准,是这一层公司的典型做法,也是共同软肋。Inherent 做得相对认真,但距离“独立、可审计”还有距离。

Inherent 的思路有一个历史参照。工厂刚接入电力时只是把蒸汽机换成电动机,生产率没变;飞跃要等到厂房布局和管理方式都围绕电力重新设计之后。Inherent 盯的是后面这一步。接下来看有没有原创发现、能否跨领域迁移,以及 PBC 治理怎么约束一间逐渐自动化的实验室。

1

三、反馈来自自己实验室的运转:Core Automation 与 Mirendil

前两层改进的对象是明确的:一个 Kernel,一个分数。这一层改进的对象是实验室本身:先用 AI 自动化自己的研究,省下的研究能力再去发现下一批可自动化的环节。公司自己是第一个客户。这也意味着它们公开的东西最少。

4. Core Automation:https://www.coreauto.com


创始人 Jerry Tworek 在 OpenAI 近七年,长期参与强化学习、推理模型和 Agent 研究;Rohan Anil 来自 Google Brain/DeepMind 与 Anthropic。公开团队还有 Julia Villagra、Joanne Jang、Mark Saroufim 等,横跨前沿模型、模型行为和 PyTorch 系统。

Core 要建一间高度自动化的 AI Lab,用它寻找超越大规模预训练和现有 RL 的学习算法,以及比 Transformer 更能扩展的架构。目前没有模型、产品或 Benchmark,公开内容接近路线图。

唯一落到具体问题上的是 Mark Saroufim 的博客。他回顾参与 KernelBot 时,Agent 生成 Kernel 会出现 Reward Hacking:找到让分数变高但没解决问题的捷径,比如绕过测试、只优化测试覆盖到的情况。团队把人工审计积累成数据,构建了 KernelGuard 检查规则。

Core 的优势是研究和系统能力在同一个团队。很多自动研究 Demo 在小代码库里表现好,进入前沿训练就会卡在集群调度、Kernel、数据管线和失败恢复上。让架构和基础设施一起演进,比单个 AI Scientist 更接近自动化实验室。但它也是七家里“资本先于证据”最明显的一家。

后续值得关注的发展在于,第一个公开成果是不是 Agent 主导;自动化省了多少研究员时间;新算法能否脱离 Transformer 配方。

5. Mirendil:https://mirendil.com


创始人 Behnam Neyshabur 曾在 Google 和 Anthropic 做 AI for Science 与 AI R&D;Harsh Mehta 曾在 Anthropic 独立搭建早期 AutoResearch 平台;Shayan Salehian 是 xAI 早期 ML 工程成员;Tara Rezaei 毕业于 MIT。首发团队约 20 人,来自 Anthropic、xAI、DeepMind 和 OpenAI。2 亿美元种子轮,a16z 和 Kleiner Perkins 领投,NVIDIA 参与。

和 Core 的差别在于路径。Core 强调找新算法,Mirendil 强调先训练一个专门擅长 AI 研究的前沿模型,再围绕它重建实验平台:代码、训练、评估、调试、Kernel、Checkpoint 比较、算力管理。8 月和 Google Cloud 签了多年合作,同时用 TPU 和 NVIDIA,跑预训练到大规模 RL 和并行研究循环的全部负载。

Mirendil 押的是数据飞轮。通用模型的训练数据里缺少完整的 AI 研究轨迹,从提出想法到调试失败到比较结果。一个专用模型每天在自己平台里做这些事,就可能积累外部复制不了的数据。

到这个飞轮目前还在设想阶段:没有模型、演示、Benchmark。2 亿美元说明它付得起实验账单,不说明它的模型比通用编码 Agent 更会做研究。

后续可以观察的方向是,它独立完成了多少可复现研究;改进发生在权重、Harness 还是人工流程里;客户能否在不复制一整间实验室的前提下用上它。

1

四、反馈来自整个发现过程:Recursive 与 Discovery Loop

最后两家不只要改进模型,还要改进研究过程本身,并最终走出机器学习。

6. Recursive Superintelligence :https://www.recursive.com


八位创始人 Richard Socher、田渊栋、Tim Rocktäschel、Alexey Dosovitskiy、Josh Tobin、熊蔡明、Tim Shi、Jeff Clune,覆盖 Salesforce AI、Meta FAIR、DeepMind、OpenAI、Uber AI。6.5 亿美元融资,投后估值 46.5 亿美元,GV 和 Greycroft 领投,NVIDIA、AMD Ventures 参与。

系统做的事和 rekursiv.ai 类似,多出的部分是同时维护多条长期研究分支,合并有希望的路线,并在接受结果前检查是不是 Reward Hack、是不是随机波动。

6 月公布了三项结果:NanoChat 的 Validation BPB(每字节比特数,越低越好)从 0.9372 降到 0.9109,换算成达到同等 Loss 的训练速度提高 1.3 倍;NanoGPT 达到指定 Loss 的时间从 79.7 秒降到 77.5 秒;SOL-ExecBench 的 235 个 Kernel 平均分从 0.699 升到 0.754,到理想值 1.0 的差距缩小 18%。

NanoGPT 缩短 2.2 秒,数字本身不值一提。值得一提的是它跑通了提方案、做实验、验证、保留改进的完整闭环,并公开了方法、部分 Artifact 和不确定性。七家里,Recursive 是目标写得最激进(系统未来要改进自己的代码库、Benchmark 和研究过程)、同时又拿出了可检查数据的一家。Jeff Clune 和 Tim Rocktäschel 在开放式算法(让系统自己不断生成新问题和新解法,而不收敛到固定目标)上的十几年积累,是它有机会从“批量跑实验”推进到“改进研究方法”的原因。

更大的挑战在于这些经验能否带到陌生任务,多轮后能否用更少实验找到更好方案;外部团队能否复现。

7. Discovery Loop:https://www.discoveryloop.com/


创始人 Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc V. Le。Dean 和 Ghemawat 参与建立了 GFS、MapReduce、Bigtable 和 Spanner;Vinyals 的工作涉及 Seq2Seq、AlphaStar、AlphaCode;Le 长期研究大规模学习、神经架构搜索和模型蒸馏。首轮由 Radical Ventures 和 Khosla Ventures 领投,Lightspeed、Kleiner Perkins、Doerr Capital 和 Alphabet 参与,金额未公布。

它目前公布的路径分三步:用前沿模型和大规模算力自动化 ML 研究和工程,并行跑数千个实验;自己做第一个客户;再进入芯片、药物、材料、能源等结果可测量的领域。

创始团队星光熠熠,而他们的共同点是基础设施。Google 早期的优势正来自同一个想法能在更大数据、更短周期里被反复验证。Discovery Loop 把“实验吞吐量”当作系统工程问题来做,四人也都参与过 AutoML、AlphaChip 这类机器辅助发现项目。和 Mirendil 比,它不先训专用模型,更像一套多领域的实验操作系统;和 Recursive 比,它更早延伸到 AI 之外。

但跨度越大,疑问越明显。ML 实验几小时返回 Loss,药物和材料实验受制于物理设备、周期和安全约束,一轮要几周到几个月。结果可测量,也不等于方向值得研究。

明星大佬的团队,走出 AI 之后能否处理真实实验的复杂性,是接下来所有人都期待看到“证据”的地方。


点个爱心,再走 吧

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
0-2!曼联爆冷不敌英超升班马,卡里克创耻辱,3人不及格踢丢主力

0-2!曼联爆冷不敌英超升班马,卡里克创耻辱,3人不及格踢丢主力

小火箭爱体育
2026-08-22 21:39:01
“我女儿是榴莲和海鲜养大的”,贫民窟公主火了,网友:自己留着吧

“我女儿是榴莲和海鲜养大的”,贫民窟公主火了,网友:自己留着吧

泽泽先生
2026-08-17 14:15:09
广东某村有个女人,下地打药的时候,太热了,就在沟里洗了澡

广东某村有个女人,下地打药的时候,太热了,就在沟里洗了澡

叮当当科技
2026-08-22 18:38:43
这两个强国,真到了战争的边缘

这两个强国,真到了战争的边缘

牛弹琴
2026-08-22 08:31:12
我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

徐侠客有话说
2026-08-13 11:03:24
我们赢了!7连杀!国羽独苗杀疯了,今天却把对手打得怀疑人生!

我们赢了!7连杀!国羽独苗杀疯了,今天却把对手打得怀疑人生!

不同时代的魅力
2026-08-22 00:33:17
干掉保时捷的并非经济下行! 是57万卖35万还没人要: 反手买国产车

干掉保时捷的并非经济下行! 是57万卖35万还没人要: 反手买国产车

离离言几许
2026-08-20 15:33:08
藏匿无罪证据致张志超坐15年冤狱的检察官升副检察长

藏匿无罪证据致张志超坐15年冤狱的检察官升副检察长

追月数星
2026-08-21 21:51:01
邵佳一看到了吗?18岁小将闪耀中超!球迷:这1条龙让人目瞪口呆

邵佳一看到了吗?18岁小将闪耀中超!球迷:这1条龙让人目瞪口呆

足球大腕
2026-08-23 00:43:26
钱不好挣了,2026年、2027年、2028年这三年,请牢记5大忠告

钱不好挣了,2026年、2027年、2028年这三年,请牢记5大忠告

猫叔东山再起
2026-08-22 09:35:08
炸裂!亚航排泄事件后续:阿姨自曝原因,乘客被熏醒,离厕所不到5米远

炸裂!亚航排泄事件后续:阿姨自曝原因,乘客被熏醒,离厕所不到5米远

小鋭有话说
2026-08-22 22:54:16
上海13岁女儿不够独立,半夜总跑去和爷爷睡,母亲推开门当场崩溃

上海13岁女儿不够独立,半夜总跑去和爷爷睡,母亲推开门当场崩溃

温情邮局
2025-04-09 16:55:04
国新办发布会结束!2026养老金上调消息,为什么这次没有公布?

国新办发布会结束!2026养老金上调消息,为什么这次没有公布?

白昼说故事
2026-08-22 09:38:39
快扔掉,戴一天,辐射量相当于拍117次胸片

快扔掉,戴一天,辐射量相当于拍117次胸片

北青网-北京青年报
2026-06-22 11:00:34
31岁女星红毯穿无底鞋脚趾涂黑漆引爆热议

31岁女星红毯穿无底鞋脚趾涂黑漆引爆热议

追星雷达站
2026-08-22 00:42:46
陪玩陪睡只是开胃!百亿富豪国外偷腥,更下作的还在后面

陪玩陪睡只是开胃!百亿富豪国外偷腥,更下作的还在后面

怪味历史连连看
2026-08-17 15:33:28
升学宴5死再升级!亲历者终于说出实情,墙塌另有原因,本可避免

升学宴5死再升级!亲历者终于说出实情,墙塌另有原因,本可避免

就一点
2026-08-21 15:35:53
24小时内,中方专机准点抵达,朝方发布强硬警示,离战争越来越近

24小时内,中方专机准点抵达,朝方发布强硬警示,离战争越来越近

荷兰豆爱健康
2026-08-22 08:22:11
他才是“恒大”真正主人,如今身价520亿,娶小21岁明星羡煞旁人

他才是“恒大”真正主人,如今身价520亿,娶小21岁明星羡煞旁人

林轻吟
2026-08-21 09:25:40
许家印大儿子也被捉回来,也跟着一起被判刑,真的是大快人心

许家印大儿子也被捉回来,也跟着一起被判刑,真的是大快人心

静若梨花
2026-08-22 14:13:55
2026-08-23 02:19:00
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3348文章数 10526关注度
往期回顾 全部

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

头条要闻

全季起诉“金季”索赔10万 老板娘:日租才50到60元

头条要闻

全季起诉“金季”索赔10万 老板娘:日租才50到60元

体育要闻

字母+汤神,有没有搞头?

娱乐要闻

《空枪》预测票房缩水,手握王炸都没赢

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

钛9全球首秀/四季度上市 方程S系列内饰车展亮相

态度原创

房产
艺术
亲子
旅游
数码

房产要闻

两大热盘即将入市!三亚又一批安居房狠货要炸场了!

艺术要闻

他把新加坡的老破小“P”成了未来都市!水彩界的神笔马良,看完我想搬家

亲子要闻

为什么医院分那么多科室,还要专门设立儿科? #儿科 #儿科医生

旅游要闻

视频丨看电影、赏美景 暑假到西藏“过林卡”感受别样的日光之城

数码要闻

19899元!七彩虹隐星G16 Pro新配置开卖:i9 14900HX+RTX 5090

无障碍浏览 进入关怀版