网易首页 > 网易号 > 正文 申请入驻

本周AI项目推荐|Mirendil、INT21、rekursiv.ai ……最热门RSI 公司都在“自我改进”什么

0
分享至


作者樊雅婷
微信 FFF111f__

RSI(Recursive Self-Improvement,递归自我改进)是今年 AI 创业里最密集的一个方向。

3 月,参与过 o1、o3 和 GPT-4 的 Jerry Tworek 创立 Core Automation;5 月,Richard Socher、Jeff Clune 等八位研究者组建 Recursive;随后 Mirendil、INT21、rekursiv.ai、Inherent 相继公开;8 月,Jeff Dean、Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 成立 Discovery Loop。半年之内,这些公司融资合计超过 10 亿美元,其中仅Recursive 一家的估值就有46.5 亿美元。

它们用的词不一样:self-improving AI、self-accelerating AI R&D、continual learning、AI Scientist。描述的是同一个愿景:让 AI 参与改进 AI。

如果说RSI 最严格的定义,只有一句话:AI 改进“制造下一代 AI”的方法,下一代继承了这个改进,于是能做出更好的下下代。

关键不在某一次实验跑得多好,而在改进能不能传下去。所以,按这个标准,目前没有一家公司做到。宽泛的用法把模型自我纠错、持续后训练、自动跑实验、优化 Agent 的外围工具链(Harness,模型之外负责调度、记忆、工具调用的那层软件)都叫 RSI。但按这个标准的话,那么所有做 Agent 的公司都在做 RSI。

两个标准都不好用。我们换了一种方法:不管叫什么,AI 改进 AI 都可以拆成四步,提出一个改法、执行、验证是不是真的变好了、把变好的部分保留到下一轮。七家公司的差别,是三个问题的不同答案:AI 接管了哪几步;验证信号从哪里来、有多硬;保留的改进是只在这一轮有效,还是能被下一代继承。

第二个问题最关键。能自己跑实验的系统,最大风险是给自己打高分。验证信号不够硬,系统跑得越快,积累的错误越多。

本期项目推荐就按验证信号从最硬到最软来进行梳理。

1

一、反馈来自硬件计时:INT21

1. INT21:https://int21.ai


创始人 Bing Xu 是 GAN 原始论文共同作者,此前创办的 GPU 推理公司 HippoML 被 NVIDIA 收购,在 NVIDIA 做过一段 Distinguished Engineer,2026 年 4 月创业。

INT21 让 AI 写运行 AI 的底层代码。大模型在 GPU 上的每一个数学操作(矩阵乘法、归一化、注意力)都要翻译成 GPU 直接执行的一小段程序,这就是 Kernel。同一个操作,Kernel 写得好坏能差几倍速度,而会写 Kernel 的人极少。

产品 PTX Kernel Factory 的流程:用户定义操作、正确性要求、目标硬件和性能指标,系统调度多个 Agent 生成候选实现,编译、测试、测速,淘汰错的、保留快的,把成功和失败的记录带入下一轮。每一环都能在真实 GPU 上测出来。

公司开源了四个 Kernel(KDA 和 RMSNorm 各在 B200、H100 上一版),附测试方法和环境。公布结果里,Kimi Delta Attention 在 GH200 上达到专家手写版本的 1.24 至 1.59 倍,B200 上 1.42 至 1.52 倍;RMSNorm 在 GH200 的 11 个前向测试中几何平均快 8.17%,B200 的 126 个可比案例全部领先。INT21 同时公开了两个轻微回退案例,并说明这些数字只对应单个算子,不能换算成整个模型的加速。

INT21 的优势全部来自评估器。思路接近芯片设计里的 EDA:把工程目标写成机器能检查的约束,让软件搜索人类穷举不了的空间。硬件计时是一把不会被说服的尺子,近期一项 RSI 综述也发现,已展示的自我改进强度和验证信号强度直接相关,可执行测试是最可靠的一类。

INT21 目前更像一套出色的自动调优系统,还没表现出能改“怎么搜索”本身。

接下来值得关注的是:四个 Kernel 能否变成稳定管线;一次任务的经验能否让系统更快解决新算子、新硬件;算子级加速进入完整模型后还剩多少。

1

二、反馈来自 Benchmark,AI 开始选假设:rekursiv.ai 与 Inherent

这一层的产品都叫 AI Scientist:像研究员一样读论文、提假设、写代码、跑实验、看结果、决定下一步。和 INT21 的区别是,目标函数仍是人给的,但“验证哪个假设”开始交给 AI。

2. rekursiv.ai:https://rekursiv.ai/


创始人 Joshua V. Dillon 和 Dan Kondratyuk 都来自 Google/DeepMind 和 Luma AI。Dillon 是 TensorFlow Probability 主要创建者之一,参与过 Gemini、VideoPoet 和 Veo 早期工作;Kondratyuk 是 VideoPoet 第一作者。公司入选 YC S26,团队不大。

产品被称为“自动研究的驾驶舱”:研究者给出问题,系统调度多名 AI Scientist 并行建立假设、写代码、跑实验、维护排行榜,每条结论都能追溯到原始实验记录。

2026 年 7 月的 ARC-AGI 项目是它最具体的案例。ARC-AGI 是目前最难的推理测试之一,题目是人类容易看出、模型很难掌握的抽象图形变换规律。系统在几天内跑了 235 次完整实验、15 条主要方向,7 条带来可保留的提升。单模型 ARC-AGI-1 从 44.9% 提高到 71.4%,五模型集成 75.5%;迁移到 ARC-AGI-2 得到 17.5%。公司也公开了一次失败:一个训练出来的 Verifier(判断答案对错的模型)在训练集上大幅改善,换到评估集反而下降 2 个百分点。

最终分数并不是这个案例最有价值的部分。8 个没带来改善的方向,系统怎么处理,才反映它有没有参与研究判断:能否解释失败、及时止损、据此调整下一轮。

这套能力目前被关在 ARC 的边界内。任务是人定的,指标是现成的,系统也还没在半私有测试集上提交过成绩。在公开测试集上跑 235 次实验,过拟合风险很实在。真正的科研很少有随时可查的排行榜,当指标本身需要重新设计时,才是 rekursiv.ai 的考验。

3. Inherent:https://inherentlabs.ai


创始人 Tantum Collins、Edward Hughes、Louis Kirsch、Kaloyan Aleksiev,经历覆盖 AI Scientist、AlphaProof、Genie 和自动化 AI 研究。总部伦敦,Public Benefit Corporation,2026 年公布 5000 万美元种子轮,Index Ventures 和 Radical Ventures 领投。

Inherent 把概念叫 Recursive Collective Self-Improvement:改进对象是整间实验室,开会方式、算力分配、人何时介入、组织怎么从每次实验里学习。

最具体的成果是 Faraday,一个 27B 参数的 AI Scientist,本身不大,但能调用更大的 Coding Agent 作为工具,完成机器学习和 AI for Science 的论文复现。训练环境 Replica 从 100 篇论文生成 310 个“复现这张图表”的任务,242 个训练、68 个测试,每项限时 60 分钟、只给 H200 的一小块算力。Faraday 在 73% 的同分布任务和 60% 的 AI for Science 留出任务上优于对照 Agent,平均分比 Claude Opus 4.8 和 GPT-5.5 分别高 6% 和 8%。

“优于”的判定方式挺有趣,先用 Claude Opus 4.7 生成评分标准,再用 Codex GPT-5.5 打分,另外收集 20 名专家的 117 组排序,检查 AI 评分和人类判断的一致程度。AI 给 AI 打分、少量人类校准,是这一层公司的典型做法,也是共同软肋。Inherent 做得相对认真,但距离“独立、可审计”还有距离。

Inherent 的思路有一个历史参照。工厂刚接入电力时只是把蒸汽机换成电动机,生产率没变;飞跃要等到厂房布局和管理方式都围绕电力重新设计之后。Inherent 盯的是后面这一步。接下来看有没有原创发现、能否跨领域迁移,以及 PBC 治理怎么约束一间逐渐自动化的实验室。

1

三、反馈来自自己实验室的运转:Core Automation 与 Mirendil

前两层改进的对象是明确的:一个 Kernel,一个分数。这一层改进的对象是实验室本身:先用 AI 自动化自己的研究,省下的研究能力再去发现下一批可自动化的环节。公司自己是第一个客户。这也意味着它们公开的东西最少。

4. Core Automation:https://www.coreauto.com


创始人 Jerry Tworek 在 OpenAI 近七年,长期参与强化学习、推理模型和 Agent 研究;Rohan Anil 来自 Google Brain/DeepMind 与 Anthropic。公开团队还有 Julia Villagra、Joanne Jang、Mark Saroufim 等,横跨前沿模型、模型行为和 PyTorch 系统。

Core 要建一间高度自动化的 AI Lab,用它寻找超越大规模预训练和现有 RL 的学习算法,以及比 Transformer 更能扩展的架构。目前没有模型、产品或 Benchmark,公开内容接近路线图。

唯一落到具体问题上的是 Mark Saroufim 的博客。他回顾参与 KernelBot 时,Agent 生成 Kernel 会出现 Reward Hacking:找到让分数变高但没解决问题的捷径,比如绕过测试、只优化测试覆盖到的情况。团队把人工审计积累成数据,构建了 KernelGuard 检查规则。

Core 的优势是研究和系统能力在同一个团队。很多自动研究 Demo 在小代码库里表现好,进入前沿训练就会卡在集群调度、Kernel、数据管线和失败恢复上。让架构和基础设施一起演进,比单个 AI Scientist 更接近自动化实验室。但它也是七家里“资本先于证据”最明显的一家。

后续值得关注的发展在于,第一个公开成果是不是 Agent 主导;自动化省了多少研究员时间;新算法能否脱离 Transformer 配方。

5. Mirendil:https://mirendil.com


创始人 Behnam Neyshabur 曾在 Google 和 Anthropic 做 AI for Science 与 AI R&D;Harsh Mehta 曾在 Anthropic 独立搭建早期 AutoResearch 平台;Shayan Salehian 是 xAI 早期 ML 工程成员;Tara Rezaei 毕业于 MIT。首发团队约 20 人,来自 Anthropic、xAI、DeepMind 和 OpenAI。2 亿美元种子轮,a16z 和 Kleiner Perkins 领投,NVIDIA 参与。

和 Core 的差别在于路径。Core 强调找新算法,Mirendil 强调先训练一个专门擅长 AI 研究的前沿模型,再围绕它重建实验平台:代码、训练、评估、调试、Kernel、Checkpoint 比较、算力管理。8 月和 Google Cloud 签了多年合作,同时用 TPU 和 NVIDIA,跑预训练到大规模 RL 和并行研究循环的全部负载。

Mirendil 押的是数据飞轮。通用模型的训练数据里缺少完整的 AI 研究轨迹,从提出想法到调试失败到比较结果。一个专用模型每天在自己平台里做这些事,就可能积累外部复制不了的数据。

到这个飞轮目前还在设想阶段:没有模型、演示、Benchmark。2 亿美元说明它付得起实验账单,不说明它的模型比通用编码 Agent 更会做研究。

后续可以观察的方向是,它独立完成了多少可复现研究;改进发生在权重、Harness 还是人工流程里;客户能否在不复制一整间实验室的前提下用上它。

1

四、反馈来自整个发现过程:Recursive 与 Discovery Loop

最后两家不只要改进模型,还要改进研究过程本身,并最终走出机器学习。

6. Recursive Superintelligence :https://www.recursive.com


八位创始人 Richard Socher、田渊栋、Tim Rocktäschel、Alexey Dosovitskiy、Josh Tobin、熊蔡明、Tim Shi、Jeff Clune,覆盖 Salesforce AI、Meta FAIR、DeepMind、OpenAI、Uber AI。6.5 亿美元融资,投后估值 46.5 亿美元,GV 和 Greycroft 领投,NVIDIA、AMD Ventures 参与。

系统做的事和 rekursiv.ai 类似,多出的部分是同时维护多条长期研究分支,合并有希望的路线,并在接受结果前检查是不是 Reward Hack、是不是随机波动。

6 月公布了三项结果:NanoChat 的 Validation BPB(每字节比特数,越低越好)从 0.9372 降到 0.9109,换算成达到同等 Loss 的训练速度提高 1.3 倍;NanoGPT 达到指定 Loss 的时间从 79.7 秒降到 77.5 秒;SOL-ExecBench 的 235 个 Kernel 平均分从 0.699 升到 0.754,到理想值 1.0 的差距缩小 18%。

NanoGPT 缩短 2.2 秒,数字本身不值一提。值得一提的是它跑通了提方案、做实验、验证、保留改进的完整闭环,并公开了方法、部分 Artifact 和不确定性。七家里,Recursive 是目标写得最激进(系统未来要改进自己的代码库、Benchmark 和研究过程)、同时又拿出了可检查数据的一家。Jeff Clune 和 Tim Rocktäschel 在开放式算法(让系统自己不断生成新问题和新解法,而不收敛到固定目标)上的十几年积累,是它有机会从“批量跑实验”推进到“改进研究方法”的原因。

更大的挑战在于这些经验能否带到陌生任务,多轮后能否用更少实验找到更好方案;外部团队能否复现。

7. Discovery Loop:https://www.discoveryloop.com/


创始人 Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc V. Le。Dean 和 Ghemawat 参与建立了 GFS、MapReduce、Bigtable 和 Spanner;Vinyals 的工作涉及 Seq2Seq、AlphaStar、AlphaCode;Le 长期研究大规模学习、神经架构搜索和模型蒸馏。首轮由 Radical Ventures 和 Khosla Ventures 领投,Lightspeed、Kleiner Perkins、Doerr Capital 和 Alphabet 参与,金额未公布。

它目前公布的路径分三步:用前沿模型和大规模算力自动化 ML 研究和工程,并行跑数千个实验;自己做第一个客户;再进入芯片、药物、材料、能源等结果可测量的领域。

创始团队星光熠熠,而他们的共同点是基础设施。Google 早期的优势正来自同一个想法能在更大数据、更短周期里被反复验证。Discovery Loop 把“实验吞吐量”当作系统工程问题来做,四人也都参与过 AutoML、AlphaChip 这类机器辅助发现项目。和 Mirendil 比,它不先训专用模型,更像一套多领域的实验操作系统;和 Recursive 比,它更早延伸到 AI 之外。

但跨度越大,疑问越明显。ML 实验几小时返回 Loss,药物和材料实验受制于物理设备、周期和安全约束,一轮要几周到几个月。结果可测量,也不等于方向值得研究。

明星大佬的团队,走出 AI 之后能否处理真实实验的复杂性,是接下来所有人都期待看到“证据”的地方。


点个爱心,再走 吧

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国男篮升到第五!FIBA官方盛赞杨瀚森:中国约基奇终于崛起了

中国男篮升到第五!FIBA官方盛赞杨瀚森:中国约基奇终于崛起了

追球者
2026-09-02 15:40:32
建议你一定养一个:顶嘴、拖拉、爱发脾气的孩子,长大真的有好处

建议你一定养一个:顶嘴、拖拉、爱发脾气的孩子,长大真的有好处

另子维爱读史
2026-09-02 20:03:11
全球汽车行业的“利润王”:业绩甚至追上银行,年利润超1700亿

全球汽车行业的“利润王”:业绩甚至追上银行,年利润超1700亿

柳先说
2026-09-02 20:15:23
两小时的演唱会休息80分钟?张信哲、苏有朋等明星苏州拼盘演唱会被网友吐槽,票价最高888元,主办方回应

两小时的演唱会休息80分钟?张信哲、苏有朋等明星苏州拼盘演唱会被网友吐槽,票价最高888元,主办方回应

大风新闻
2026-09-01 14:55:04
赶紧核查!1992年前干过这几类工作的,你的养老金有望更高!

赶紧核查!1992年前干过这几类工作的,你的养老金有望更高!

小鹿姐姐情感说
2026-09-01 02:44:51
张万年致电许世友:我趁热往前拱一拱,许怒斥:你摸摸脑袋热不热

张万年致电许世友:我趁热往前拱一拱,许怒斥:你摸摸脑袋热不热

芊芊子吟
2026-09-02 14:15:15
国家杰青任 211 大学副校长

国家杰青任 211 大学副校长

生物学霸
2026-09-02 17:24:37
“还我季洁!”

“还我季洁!”

中国新闻周刊
2026-09-01 16:57:38
星宇股份董事长周晓萍回应公司舆情并道歉,称公司订单“断崖式下跌”传闻不实

星宇股份董事长周晓萍回应公司舆情并道歉,称公司订单“断崖式下跌”传闻不实

时代财经
2026-09-02 14:28:25
李春平身边23名员工联名写举报信!举报利益集团安排李春平假结婚

李春平身边23名员工联名写举报信!举报利益集团安排李春平假结婚

细品名人
2026-09-01 22:35:27
性治疗室里,挤满了“不会做爱”的年轻人

性治疗室里,挤满了“不会做爱”的年轻人

十点读书
2026-09-02 19:56:12
真要无球可打了?郭艾伦未能完成注册,亲自开口,一句话叫人泪目

真要无球可打了?郭艾伦未能完成注册,亲自开口,一句话叫人泪目

开着车去流浪
2026-09-02 19:23:29
37岁女子被当街殴打扒裤,官方回应来了:打人的两个女子50多岁

37岁女子被当街殴打扒裤,官方回应来了:打人的两个女子50多岁

汉史趣闻
2026-09-02 18:14:53
越南的小心思够精明!这次吉尔吉斯斯坦举办的上合组织峰会,越南没派最高领导人出席,只让国家副主席带队参会,比起去年明显降了半格

越南的小心思够精明!这次吉尔吉斯斯坦举办的上合组织峰会,越南没派最高领导人出席,只让国家副主席带队参会,比起去年明显降了半格

扶苏聊历史
2026-09-01 15:15:37
花4500元报机器人编程,才上11课时培训机构“跑路” 家长起诉退费,胜诉5年后终于拿到退款

花4500元报机器人编程,才上11课时培训机构“跑路” 家长起诉退费,胜诉5年后终于拿到退款

红星新闻
2026-09-02 18:59:17
让大众中国告诉常州星宇: 再复制富士康式的悲剧,后果会如何

让大众中国告诉常州星宇: 再复制富士康式的悲剧,后果会如何

冷观互联网
2026-09-01 16:23:40
影响隋唐两朝历史的“鲜卑族”,是今天的哪个民族?你绝对想不到

影响隋唐两朝历史的“鲜卑族”,是今天的哪个民族?你绝对想不到

文史达观
2025-05-06 11:54:46
自曝体重40公斤还嫌不够瘦?韩女团成员言论引众怒

自曝体重40公斤还嫌不够瘦?韩女团成员言论引众怒

追星雷达站
2026-09-01 18:55:12
亚洲最穷的国家不丹:如果拿10元人民币,在不丹集市能买到什么?

亚洲最穷的国家不丹:如果拿10元人民币,在不丹集市能买到什么?

抽象派大师
2026-09-01 02:22:43
李维康告别仪式:丈夫耿其昌穿旧衣哭到站不稳,女儿五字挽联催泪

李维康告别仪式:丈夫耿其昌穿旧衣哭到站不稳,女儿五字挽联催泪

小疯子耶
2026-09-01 14:39:17
2026-09-02 20:59:00
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3372文章数 10529关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

时尚
亲子
家居
数码
本地

中国农村,挤满了花钱干农活的外国佬

亲子要闻

宝蓝和弟弟妹妹手上涂满颜料,用手掌画画,有趣又漂亮~

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

宏碁推出SFF RTX Spark迷你主机,最高128GB内存

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

无障碍浏览 进入关怀版