网易首页 > 网易号 > 正文 申请入驻

全球竞逐RSI,这支华人团队已跑通规模化闭环

0
分享至

10 月 6 日,OpenAI 公开了 AI 产出的 722 篇数学论文,包括准黎曼猜想的相关证明。前 Google 科学家、xAI 联合创始人 Christian Szegedy 表示,数学家穷尽一生攀登的险峰,机器可乘飞机直接抵达。但 Szegedy 认为,数学不是走向终结,而是探索方式的改变 —— 人们可以借助飞机,抵达更多未境之地,他自己对此兴奋不已。

这架飞机,能否继续飞向更广阔的科学与工程前沿 —— 从癌症机理、衰老干预,到尚无成熟路径的复杂工程难题?

全球 AI 实验室正将目光投向 RSI(递归自我改进):让 AI 不只完成任务,还能参与下一代 AI 的设计、训练与改进。这场系统性探索才刚刚开始,大多数探索尚处于早期。

而一支华人团队,已经把 RSI 带入了规模化运行。它打造的 Novix,将自我改进机制嵌入真实的前沿算法与工程任务,让 AI 在解决问题的过程中,持续吸收顶尖专家的判断与反馈,并将这些经验用于自身的下一轮改进。



官网链接:Novix.science

成立仅半年,Novix 通过口碑传播,已服务 20 万名专家,覆盖 40 多个国家和地区、500 多所高校及科研机构。用户中包括来自清华大学、北京大学、苏黎世联邦理工学院、剑桥大学、卡内基梅隆大学、南洋理工大学、新加坡国立大学和东京大学等机构的研究者。

不同学科和领域的实际研究已经在平台上展开:水坝群如何进行生态泄洪调度,钢材在未知地震加载下会有怎样的循环响应,低成本空气质量监测网络如何实现跨站点校准、城市干道协同控制、金融市场高频流动性建模,还有 AI 模型的后训练。

Novix 由石宇、汤嘉斌等人创立,核心成员来自 Google、微软、Meta、智谱和 Kimi,曾主导或参与 Microsoft Copilot、Kimi K2、AgentOS 和 AutoAgent 等项目。

这支华人团队为什么能率先把 RSI 推向全球规模化闭环?

答案在于,Novix 在产品、系统与算法层面,重新定义 AI 与人类顶智专家的协同进化关系。Novix 将这套机制称为 Co-Evolutionary RSI—— 协同进化式 RSI。

“机器负责加速边界的探索,人类把价值、审美和选择持续写进系统。” 石宇说。“两者共同组成一个持续运行、自我改进的智能进化系统。”

在这个回路里,AI 主动提出方向、展开解空间、执行任务并验证结果;专家持续反馈什么是重要的问题、什么证据足以成立、采用怎样的评价标准(rubrics),以及哪些方向符合自己的审美与长期判断。每一次采用、否决、纠偏和反馈,都会成为下一轮探索的新目标与新标准,并进一步改进系统的任务分解、工具使用、harness 与模型能力。

真实高难任务持续暴露系统的能力边界,专家反馈不断推动系统进化,进化后的 AI 再去解决更难的问题。Novix 规模化的,正是这个在前沿算法与工程领域中持续运行的 RSI 飞轮。

石宇说:“能真正把 RSI 做到规模化的,一定是最能杠杆人类顶尖专家审美的系统。”

让每位科学家都有自己的 AI 自主实验室

Novix 在与全球专家的持续协作中,学习每位研究者关注的问题、判断证据的方式与探索偏好,再主动提出候选方向并完成验证。科学家在关键节点选择继续、暂缓或纠偏,也可以重新定义评价标准;这些判断随即成为下一轮探索的起点。

把这种关系放进一个典型的材料研究场景:一位 PI 不必每天给系统写出完整任务,只需在候选方向中判断哪些值得推进、哪些证据不足、哪些异常值得追问;余下的探索、实验和验证由 AI 持续展开。随着判断不断积累,系统逐渐形成贴合这位研究者的探索路径。

为了探索那些连人类都尚未知晓答案的领域,最重要的是研究解空间中最值得推进的下一步。科学家的每一次选择,都在告诉系统什么是好问题、怎样判断证据、愿意承担怎样的风险,以及什么结果真正有价值。同一个基础模型,因此会沿着不同专家的 taste 生长出不同的探索路径。





不同领域的人机协同进化环境。在酶工程(图上)中,一个 “提高工业酶性能” 的目标,逐步变成关于突变组合、实际反应条件和实验取舍的具体问题;在离散扩散语言模型(图下)中,一个新型文本生成方向,逐步展开为训练、生成速度、推理能力等不同研究路线

汤嘉斌表示:“通用模型倾向于提出近似相同的问题分布,而人类专家的反馈才是决定 RSI 系统在探索人类未知时的种子变量。”

协作越久,任务分布、判断标准、失败记录和探索脉络越完整,最终沉淀为属于个人或实验室难以复制的研究资产和数据壁垒。这些数据保留在专属空间中,只服务于对应的用户或组织。

会做,正在成为 Agent 的标配;知道什么值得做,才是探索式智能的分水岭。Novix 不等待科学家交付一张完整的任务清单,而是持续发现、筛选并验证值得推进的下一步。

当 AI 把执行与验证的边际成本压到接近于零,决定研究上限的就不再是 “能试多少次”,而是 “知道什么值得试”。执行被无限放大,科学家的 taste 就成为智能进化的方向盘。

Novix 想要放大顶尖专家判断的作用半径。过去,这样的判断可能只能影响一名学生、一个项目或一次实验,如今被转化为持续驱动 AI 探索知识边界的系统变量。

团队产品合伙人施蓓提到 “衡量这套系统的尺度,不是一次完成多少任务,而是专家的一次判断能把探索推进多远。”

三个前沿任务中的 RSI 闭环

方向确定后,Novix 会组织多个 Agent 调度算力、处理数据、设计方法、搭建环境并运行训练或仿真。科学家不必介入每次工具调用,只在证据、标准或方向需要变化时介入。石宇把科学家一次判断所能支撑的探索方向的优化,称为 “人类审美的杠杆”。

前沿科研不是把既定任务一路跑到底:实验会推翻假设,新证据会迫使系统修改策略,局部指标的提升也可能让研究偏离真正的问题。“产品与系统机制的设计必须容纳这个过程。” 石宇说。

因此,Novix 把材料、目标、评价标准、工具调用、中间产物和失败记录保留在同一工作空间。研究者不必盯住每一步,却能在需要时追溯系统为什么修改参数、哪条路径失败、偏差从哪里出现。失败不是被清理的噪声,而是系统资产:它既告诉 Agent 哪条路走不通,也暴露工具、环境、评估器和模型还缺什么。

三个公开任务提供了更具体的观察窗口:训练模型、调度复杂基础设施、预测材料在未知工况下的响应。它们过去都高度依赖顶尖专家的持续参与。

让 AI 自主端到端完成模型后训练

这是 RSI 核心的一类任务:Agent 直接参与模型能力的训练与选择。Novix 自主完成数据构造、训练代码、SFT、GRPO 或 RFT、检查点比较与最终交付。在 SynLogic 的 135 道固定评测题上,Qwen2.5-7B 准确率从 8.89% 提升至 37.78%;在 ScienceWorld 的 30 项代表任务中,Qwen2.5-7B-Instruct 平均得分从 11.2667 提升至 35.6333。



过程中还有一次堪称 “神来之笔” 的判断:后续强化学习的训练 loss 仍在下降,Novix 却发现模型在真实任务探针中的得分从 38.7 跌至 21.1—— 模型只是更会拟合训练轨迹,却没有变得更会解决问题。Novix 主动否决了这次更新,恢复并交付表现更好的模型。AI for AI 最关键的能力,不是让每一轮训练都继续,而是判断模型是否真的变得更聪明,并在必要时停止、回退和重新选择进化方向。



更重要的是,这些训练任务不只改进被训练的模型。数据、日志、失败路径与评测结果也会回流 Novix,用于改进它自身的任务分解、工具选择、评估器和模型,由此形成 AI for AI 的递归闭环。

在多约束情况下求解联邦水坝耦合控制

在一项基于真实河流记录的泄洪调度模拟任务中,Novix 需要为哥伦比亚河与斯内克河上的八座水坝逐小时分配泄洪量。泄洪能帮助幼鱼绕开发电机组,却会抬高水中的总溶解气体,带来生态风险;上游的调整还会延迟影响下游。

在约 3.57 小时的有效用时内,Novix 完成了 578 次工具调用,反复数据处理、算法开发、运行实验,并根据反馈持续修正预测与控制策略。它发现一处气体传播时距被错误设为 44 小时,重新推导后将其修正为 16 小时;还发现,预测误差降低并不必然改善调度效果,于是放弃跨季节表现不稳定的方案,转而根据预测误差对调度成本的影响重新设计优化目标。候选方案形成后,验证仍在继续 —— 它不仅检查预测是否准确,还检验这些预测能否带来更好的决策。



Novix 在发电要求、气体上限和复杂运行规则之间,找到八座水坝协同运行的控制策略。

最终,Novix 在研究期间不可见的 16 个独立测试周中取得 0.719264 的得分,较题方专家参考方案高出 6.50%,所有控制指令均通过执行约束检查。它交付的不是一份泛泛的调度建议,而是一套能够逐坝、逐小时输出决策的可执行控制器。这个案例展示了 Novix 如何通过持续调用工具、纠正预测和调整策略,把一个复杂问题推进到经过验证、可以运行的结果。

预测钢材在未知地震加载下的循环响应

地震发生时,钢结构会反复承受拉伸和压缩。要预测它在这样的过程中如何变形,不能只看某一次受力:此前经历了什么,也会影响材料接下来的表现。因此,从已有试验中建立的模型,能否适用于另一种受力过程,是材料研究中需要检验的问题。

Novix 从已有拉伸和循环试验出发,自主提出本构假设、修改数值实现并反复验证。在 60 个研究期间不可见的加载历程上,它取得 0.620034 的题方保留测试得分,约为专家参考解 0.310910 的 1.99 倍,所有实例均返回有效结果。





60 个实例全部生成有效结果,且全部超过基础方案。证明 Novix 能够从有限的既有试验中提出本构假设、构建模型、完成参数标定,再把获得的材料规律迁移到从未见过的加载路径上

这些任务的共同点在于,答案无法一次生成,必须在实验、失败和评价中不断收敛。

而每一次收敛留下的数据、失败路径与专家判断,都会回流系统,成为下一轮探索的起点。这也正是 RSI 闭环在真实任务中的样子。

更强智能时代的人机关系

石宇曾在微软参与 Microsoft Copilot 从零到亿级用户的增长,并作为 MS AgentOS 创始产品经理推进前沿 AI 产品化。汤嘉斌拥有香港大学博士学位,曾参与 Kimi K2 后训练,并主导 AutoAgent 和 AI-researcher 开源项目。

团队其他成员包括来自 Meta、微软的算法研究人员,以及具有 Google、微软和 Amazon 产品经验的成员,覆盖模型后训练、Agent 系统、基础设施与产品设计。这组背景也解释了 Novix 团队为什么会把模型改进、Agent 系统和用户长期协作视为同一个问题。

他们在实践中愈发感到,顶级专家不是一份等待 AI 提取完毕的静态知识库。他会被新证据说服,会对意外结果产生兴趣,也会放弃过去坚持的解释。AI 带回的新发现会改变人的判断,人的新判断又会改变 AI 的下一轮探索。Co-Evolution 让双方在不断出现的新问题中共同进化。

即便 Agent 有一天超越人类既有的智力边界,这种协同仍会继续产生价值。开放式任务的方向会在真实任务、专家反馈和新的科学发现中不断演化;越多具有不同 taste 的专家进入回路,系统获得的目标、标准和现实约束就越丰富,能够抵达的知识边界也越广。

更强的基础模型会抬高所有人的能力下限,却不会抹平不同研究者的问题意识。通用能力决定 AI 能做多少事,长期协作形成的 taste 决定这些能力被用于什么问题。两条能力轴线相互正交:基础模型越强,个体化探索引擎的分化价值反而越大。

RSI 越向前发展,人类最稀缺的判断越会成为智能递归的关键变量。

Novix 已经把这场 Co-evolution 做成了一座每个科学家都能拥有的 AI 自主实验室。在这里,AI 不知疲倦地展开探索,科学家不断收获研究成果,用并自己的 taste 决定什么值得进入下一轮研究。

这也是 Novix 正在验证的协同进化 RSI 路径 ——AI 探索未知,人类选择未来。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
15999起!iPhone Duo下周开订,京东预约逼近200万,苹果还玩起了当面激活

15999起!iPhone Duo下周开订,京东预约逼近200万,苹果还玩起了当面激活

泡泡网
2026-10-09 11:15:11
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
NBA中国赛今晚开打 全场1/5的观众是淘宝88VIP

NBA中国赛今晚开打 全场1/5的观众是淘宝88VIP

封面新闻
2026-10-09 14:37:01
突发!尊界踏板断裂测试,原视频微博消失,网友直言“懂车帝认输了”

突发!尊界踏板断裂测试,原视频微博消失,网友直言“懂车帝认输了”

火山詩话
2026-10-09 07:43:48
今晚7点半决赛!中国女篮PK澳大利亚,陈楠手握利好,翻身机会来了

今晚7点半决赛!中国女篮PK澳大利亚,陈楠手握利好,翻身机会来了

萌兰聊个球
2026-10-09 08:51:58
人妻熟女街头瑜伽套装|灰调紧身穿搭尽显丰腴曲线

人妻熟女街头瑜伽套装|灰调紧身穿搭尽显丰腴曲线

只要高兴就好
2026-10-09 13:36:15
奥迪金属刹车踏板支架出圈!踏板材质争议持续发酵,金属与玻纤塑料,两种工程路线该如何看待?

奥迪金属刹车踏板支架出圈!踏板材质争议持续发酵,金属与玻纤塑料,两种工程路线该如何看待?

火山詩话
2026-10-09 08:33:05
浓眉首秀16+7!奇才险胜尼克斯 特雷杨15分布伦森三分6中1

浓眉首秀16+7!奇才险胜尼克斯 特雷杨15分布伦森三分6中1

醉卧浮生
2026-10-09 10:01:17
为什么不吃猪肉和牛肉后,血脂一下子就降下来了?原因究竟是啥?

为什么不吃猪肉和牛肉后,血脂一下子就降下来了?原因究竟是啥?

路医生健康科普
2026-10-09 12:35:07
两日跌停的江淮汽车更大的风暴还在后面

两日跌停的江淮汽车更大的风暴还在后面

凤眼论
2026-10-09 12:08:35
WTT中国大满贯:4强席位诞生!国乒独苗3-0,半决赛迎战世界第1

WTT中国大满贯:4强席位诞生!国乒独苗3-0,半决赛迎战世界第1

晚雾空青
2026-10-08 17:45:37
星链15000颗卫星获批直连手机,这次真能绕开运营商了

星链15000颗卫星获批直连手机,这次真能绕开运营商了

数码Antenna
2026-10-08 16:08:08
“二女儿会恨死你”,家长晒两娃名字,有些弊病简直刻在骨子里

“二女儿会恨死你”,家长晒两娃名字,有些弊病简直刻在骨子里

世界圈
2026-10-09 09:54:18
追尾一定是后车全责?女司机高速35公里/小时龟速行驶被追尾,称天黑看不清开慢点安全;交警:女司机与后车司机同等责任

追尾一定是后车全责?女司机高速35公里/小时龟速行驶被追尾,称天黑看不清开慢点安全;交警:女司机与后车司机同等责任

扬子晚报
2026-10-09 10:21:52
“我知道真相”:俄罗斯重大鼠疫事件细节曝光,科学家母亲称试管打不碎

“我知道真相”:俄罗斯重大鼠疫事件细节曝光,科学家母亲称试管打不碎

全球吃瓜现场
2026-10-08 18:04:09
底价3.58亿,上海75年老牌医院整体挂牌转让

底价3.58亿,上海75年老牌医院整体挂牌转让

赛柏蓝
2026-10-08 21:51:32
男导演拍小“黄片”,20部获利上百万,2021年每集成本仅3万,就是累坏演员了

男导演拍小“黄片”,20部获利上百万,2021年每集成本仅3万,就是累坏演员了

汉史趣闻
2026-10-09 09:22:26
乌媒:中国仍在使用KD-63反舰导弹,苏联P-15“白蚁”的仿制品

乌媒:中国仍在使用KD-63反舰导弹,苏联P-15“白蚁”的仿制品

零度Military
2026-10-08 21:58:43
大闹航班的欧某某最新进展:企业迟迟不敢认领,背后的现实太扎心

大闹航班的欧某某最新进展:企业迟迟不敢认领,背后的现实太扎心

一盅情怀
2026-10-08 13:13:12
裁掉6000名美国员工,却招聘6300名H-1B员工!微软遭重罚,员工申请绿卡被叫停

裁掉6000名美国员工,却招聘6300名H-1B员工!微软遭重罚,员工申请绿卡被叫停

大洛杉矶LA
2026-10-09 01:31:31
2026-10-09 14:52:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14161文章数 142748关注度
往期回顾 全部

科技要闻

字节"干扰模型训练"实习生融资近2亿元

头条要闻

男子下楼抽烟2分钟 价值3000万港币黄金被换成柔顺剂

头条要闻

男子下楼抽烟2分钟 价值3000万港币黄金被换成柔顺剂

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

蔡康永回应,装都不装了!

财经要闻

央行为何发布关于人民币汇率的政策立场

汽车要闻

不想改车又不想撞衫 来看看小鹏P7+的黑武士版

态度原创

家居
房产
艺术
本地
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

中旅投资:以首发经济作答,定义人工冲浪产业的中国方案

艺术要闻

苏州第二高楼突破100米,“移动造楼工厂”显威力!

本地新闻

转型再出发 奋勇打头阵

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版