网易首页 > 网易号 > 正文 申请入驻

全球竞逐RSI,这支华人团队已跑通规模化闭环

0
分享至

10 月 6 日,OpenAI 公开了 AI 产出的 722 篇数学论文,包括准黎曼猜想的相关证明。前 Google 科学家、xAI 联合创始人 Christian Szegedy 表示,数学家穷尽一生攀登的险峰,机器可乘飞机直接抵达。但 Szegedy 认为,数学不是走向终结,而是探索方式的改变 —— 人们可以借助飞机,抵达更多未境之地,他自己对此兴奋不已。

这架飞机,能否继续飞向更广阔的科学与工程前沿 —— 从癌症机理、衰老干预,到尚无成熟路径的复杂工程难题?

全球 AI 实验室正将目光投向 RSI(递归自我改进):让 AI 不只完成任务,还能参与下一代 AI 的设计、训练与改进。这场系统性探索才刚刚开始,大多数探索尚处于早期。

而一支华人团队,已经把 RSI 带入了规模化运行。它打造的 Novix,将自我改进机制嵌入真实的前沿算法与工程任务,让 AI 在解决问题的过程中,持续吸收顶尖专家的判断与反馈,并将这些经验用于自身的下一轮改进。



官网链接:Novix.science

成立仅半年,Novix 通过口碑传播,已服务 20 万名专家,覆盖 40 多个国家和地区、500 多所高校及科研机构。用户中包括来自清华大学、北京大学、苏黎世联邦理工学院、剑桥大学、卡内基梅隆大学、南洋理工大学、新加坡国立大学和东京大学等机构的研究者。

不同学科和领域的实际研究已经在平台上展开:水坝群如何进行生态泄洪调度,钢材在未知地震加载下会有怎样的循环响应,低成本空气质量监测网络如何实现跨站点校准、城市干道协同控制、金融市场高频流动性建模,还有 AI 模型的后训练。

Novix 由石宇、汤嘉斌等人创立,核心成员来自 Google、微软、Meta、智谱和 Kimi,曾主导或参与 Microsoft Copilot、Kimi K2、AgentOS 和 AutoAgent 等项目。

这支华人团队为什么能率先把 RSI 推向全球规模化闭环?

答案在于,Novix 在产品、系统与算法层面,重新定义 AI 与人类顶智专家的协同进化关系。Novix 将这套机制称为 Co-Evolutionary RSI—— 协同进化式 RSI。

“机器负责加速边界的探索,人类把价值、审美和选择持续写进系统。” 石宇说。“两者共同组成一个持续运行、自我改进的智能进化系统。”

在这个回路里,AI 主动提出方向、展开解空间、执行任务并验证结果;专家持续反馈什么是重要的问题、什么证据足以成立、采用怎样的评价标准(rubrics),以及哪些方向符合自己的审美与长期判断。每一次采用、否决、纠偏和反馈,都会成为下一轮探索的新目标与新标准,并进一步改进系统的任务分解、工具使用、harness 与模型能力。

真实高难任务持续暴露系统的能力边界,专家反馈不断推动系统进化,进化后的 AI 再去解决更难的问题。Novix 规模化的,正是这个在前沿算法与工程领域中持续运行的 RSI 飞轮。

石宇说:“能真正把 RSI 做到规模化的,一定是最能杠杆人类顶尖专家审美的系统。”

让每位科学家都有自己的 AI 自主实验室

Novix 在与全球专家的持续协作中,学习每位研究者关注的问题、判断证据的方式与探索偏好,再主动提出候选方向并完成验证。科学家在关键节点选择继续、暂缓或纠偏,也可以重新定义评价标准;这些判断随即成为下一轮探索的起点。

把这种关系放进一个典型的材料研究场景:一位 PI 不必每天给系统写出完整任务,只需在候选方向中判断哪些值得推进、哪些证据不足、哪些异常值得追问;余下的探索、实验和验证由 AI 持续展开。随着判断不断积累,系统逐渐形成贴合这位研究者的探索路径。

为了探索那些连人类都尚未知晓答案的领域,最重要的是研究解空间中最值得推进的下一步。科学家的每一次选择,都在告诉系统什么是好问题、怎样判断证据、愿意承担怎样的风险,以及什么结果真正有价值。同一个基础模型,因此会沿着不同专家的 taste 生长出不同的探索路径。





不同领域的人机协同进化环境。在酶工程(图上)中,一个 “提高工业酶性能” 的目标,逐步变成关于突变组合、实际反应条件和实验取舍的具体问题;在离散扩散语言模型(图下)中,一个新型文本生成方向,逐步展开为训练、生成速度、推理能力等不同研究路线

汤嘉斌表示:“通用模型倾向于提出近似相同的问题分布,而人类专家的反馈才是决定 RSI 系统在探索人类未知时的种子变量。”

协作越久,任务分布、判断标准、失败记录和探索脉络越完整,最终沉淀为属于个人或实验室难以复制的研究资产和数据壁垒。这些数据保留在专属空间中,只服务于对应的用户或组织。

会做,正在成为 Agent 的标配;知道什么值得做,才是探索式智能的分水岭。Novix 不等待科学家交付一张完整的任务清单,而是持续发现、筛选并验证值得推进的下一步。

当 AI 把执行与验证的边际成本压到接近于零,决定研究上限的就不再是 “能试多少次”,而是 “知道什么值得试”。执行被无限放大,科学家的 taste 就成为智能进化的方向盘。

Novix 想要放大顶尖专家判断的作用半径。过去,这样的判断可能只能影响一名学生、一个项目或一次实验,如今被转化为持续驱动 AI 探索知识边界的系统变量。

团队产品合伙人施蓓提到 “衡量这套系统的尺度,不是一次完成多少任务,而是专家的一次判断能把探索推进多远。”

三个前沿任务中的 RSI 闭环

方向确定后,Novix 会组织多个 Agent 调度算力、处理数据、设计方法、搭建环境并运行训练或仿真。科学家不必介入每次工具调用,只在证据、标准或方向需要变化时介入。石宇把科学家一次判断所能支撑的探索方向的优化,称为 “人类审美的杠杆”。

前沿科研不是把既定任务一路跑到底:实验会推翻假设,新证据会迫使系统修改策略,局部指标的提升也可能让研究偏离真正的问题。“产品与系统机制的设计必须容纳这个过程。” 石宇说。

因此,Novix 把材料、目标、评价标准、工具调用、中间产物和失败记录保留在同一工作空间。研究者不必盯住每一步,却能在需要时追溯系统为什么修改参数、哪条路径失败、偏差从哪里出现。失败不是被清理的噪声,而是系统资产:它既告诉 Agent 哪条路走不通,也暴露工具、环境、评估器和模型还缺什么。

三个公开任务提供了更具体的观察窗口:训练模型、调度复杂基础设施、预测材料在未知工况下的响应。它们过去都高度依赖顶尖专家的持续参与。

让 AI 自主端到端完成模型后训练

这是 RSI 核心的一类任务:Agent 直接参与模型能力的训练与选择。Novix 自主完成数据构造、训练代码、SFT、GRPO 或 RFT、检查点比较与最终交付。在 SynLogic 的 135 道固定评测题上,Qwen2.5-7B 准确率从 8.89% 提升至 37.78%;在 ScienceWorld 的 30 项代表任务中,Qwen2.5-7B-Instruct 平均得分从 11.2667 提升至 35.6333。



过程中还有一次堪称 “神来之笔” 的判断:后续强化学习的训练 loss 仍在下降,Novix 却发现模型在真实任务探针中的得分从 38.7 跌至 21.1—— 模型只是更会拟合训练轨迹,却没有变得更会解决问题。Novix 主动否决了这次更新,恢复并交付表现更好的模型。AI for AI 最关键的能力,不是让每一轮训练都继续,而是判断模型是否真的变得更聪明,并在必要时停止、回退和重新选择进化方向。



更重要的是,这些训练任务不只改进被训练的模型。数据、日志、失败路径与评测结果也会回流 Novix,用于改进它自身的任务分解、工具选择、评估器和模型,由此形成 AI for AI 的递归闭环。

在多约束情况下求解联邦水坝耦合控制

在一项基于真实河流记录的泄洪调度模拟任务中,Novix 需要为哥伦比亚河与斯内克河上的八座水坝逐小时分配泄洪量。泄洪能帮助幼鱼绕开发电机组,却会抬高水中的总溶解气体,带来生态风险;上游的调整还会延迟影响下游。

在约 3.57 小时的有效用时内,Novix 完成了 578 次工具调用,反复数据处理、算法开发、运行实验,并根据反馈持续修正预测与控制策略。它发现一处气体传播时距被错误设为 44 小时,重新推导后将其修正为 16 小时;还发现,预测误差降低并不必然改善调度效果,于是放弃跨季节表现不稳定的方案,转而根据预测误差对调度成本的影响重新设计优化目标。候选方案形成后,验证仍在继续 —— 它不仅检查预测是否准确,还检验这些预测能否带来更好的决策。



Novix 在发电要求、气体上限和复杂运行规则之间,找到八座水坝协同运行的控制策略。

最终,Novix 在研究期间不可见的 16 个独立测试周中取得 0.719264 的得分,较题方专家参考方案高出 6.50%,所有控制指令均通过执行约束检查。它交付的不是一份泛泛的调度建议,而是一套能够逐坝、逐小时输出决策的可执行控制器。这个案例展示了 Novix 如何通过持续调用工具、纠正预测和调整策略,把一个复杂问题推进到经过验证、可以运行的结果。

预测钢材在未知地震加载下的循环响应

地震发生时,钢结构会反复承受拉伸和压缩。要预测它在这样的过程中如何变形,不能只看某一次受力:此前经历了什么,也会影响材料接下来的表现。因此,从已有试验中建立的模型,能否适用于另一种受力过程,是材料研究中需要检验的问题。

Novix 从已有拉伸和循环试验出发,自主提出本构假设、修改数值实现并反复验证。在 60 个研究期间不可见的加载历程上,它取得 0.620034 的题方保留测试得分,约为专家参考解 0.310910 的 1.99 倍,所有实例均返回有效结果。





60 个实例全部生成有效结果,且全部超过基础方案。证明 Novix 能够从有限的既有试验中提出本构假设、构建模型、完成参数标定,再把获得的材料规律迁移到从未见过的加载路径上

这些任务的共同点在于,答案无法一次生成,必须在实验、失败和评价中不断收敛。

而每一次收敛留下的数据、失败路径与专家判断,都会回流系统,成为下一轮探索的起点。这也正是 RSI 闭环在真实任务中的样子。

更强智能时代的人机关系

石宇曾在微软参与 Microsoft Copilot 从零到亿级用户的增长,并作为 MS AgentOS 创始产品经理推进前沿 AI 产品化。汤嘉斌拥有香港大学博士学位,曾参与 Kimi K2 后训练,并主导 AutoAgent 和 AI-researcher 开源项目。

团队其他成员包括来自 Meta、微软的算法研究人员,以及具有 Google、微软和 Amazon 产品经验的成员,覆盖模型后训练、Agent 系统、基础设施与产品设计。这组背景也解释了 Novix 团队为什么会把模型改进、Agent 系统和用户长期协作视为同一个问题。

他们在实践中愈发感到,顶级专家不是一份等待 AI 提取完毕的静态知识库。他会被新证据说服,会对意外结果产生兴趣,也会放弃过去坚持的解释。AI 带回的新发现会改变人的判断,人的新判断又会改变 AI 的下一轮探索。Co-Evolution 让双方在不断出现的新问题中共同进化。

即便 Agent 有一天超越人类既有的智力边界,这种协同仍会继续产生价值。开放式任务的方向会在真实任务、专家反馈和新的科学发现中不断演化;越多具有不同 taste 的专家进入回路,系统获得的目标、标准和现实约束就越丰富,能够抵达的知识边界也越广。

更强的基础模型会抬高所有人的能力下限,却不会抹平不同研究者的问题意识。通用能力决定 AI 能做多少事,长期协作形成的 taste 决定这些能力被用于什么问题。两条能力轴线相互正交:基础模型越强,个体化探索引擎的分化价值反而越大。

RSI 越向前发展,人类最稀缺的判断越会成为智能递归的关键变量。

Novix 已经把这场 Co-evolution 做成了一座每个科学家都能拥有的 AI 自主实验室。在这里,AI 不知疲倦地展开探索,科学家不断收获研究成果,用并自己的 taste 决定什么值得进入下一轮研究。

这也是 Novix 正在验证的协同进化 RSI 路径 ——AI 探索未知,人类选择未来。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
对普通民众来说,比疫情更可怕的是在过度恐慌中把自己的正当权利拱手让出

对普通民众来说,比疫情更可怕的是在过度恐慌中把自己的正当权利拱手让出

壹家言
2026-10-09 10:25:34
日乒组合闹内讧了?松岛辉空赛后不装了,一番话直戳张本美和心窝

日乒组合闹内讧了?松岛辉空赛后不装了,一番话直戳张本美和心窝

原来仙女不讲理
2026-10-10 01:08:45
江淮汽车回应尊界V800懂车帝测试

江淮汽车回应尊界V800懂车帝测试

第一财经资讯
2026-10-08 14:43:40
苏州回头率第一的车牌,估值百万,劳斯莱斯看了都羡慕

苏州回头率第一的车牌,估值百万,劳斯莱斯看了都羡慕

阿芒娱乐说
2026-10-10 09:58:53
“权贵们的新套路!”北理工裴轶的来时路被扒:和协和4+4竟是一个套路

“权贵们的新套路!”北理工裴轶的来时路被扒:和协和4+4竟是一个套路

妍妍教育日记
2026-10-05 10:10:15
远离满嘴“家国大义”的人

远离满嘴“家国大义”的人

难得君
2026-10-04 14:53:26
被停职审查、套现开溜、私生活混乱,董明珠身上标签该真相大白了

被停职审查、套现开溜、私生活混乱,董明珠身上标签该真相大白了

眼底星碎
2026-10-09 12:19:24
日本人看得透亮!中日一旦开战,中国根本不会只打眼前一仗

日本人看得透亮!中日一旦开战,中国根本不会只打眼前一仗

张鴘喜欢软软糯糯
2026-10-10 10:40:54
俄媒:“风暴阴影”袭击致20名俄军官死亡,创已知单次最多

俄媒:“风暴阴影”袭击致20名俄军官死亡,创已知单次最多

桂系007
2026-10-10 09:25:31
马化腾、姚顺雨罕见同框

马化腾、姚顺雨罕见同框

第一财经资讯
2026-10-10 00:18:06
何洁晒3孩子定居国外读书,11岁大女儿变瘦变美了,7岁小女儿戴珍珠耳钉

何洁晒3孩子定居国外读书,11岁大女儿变瘦变美了,7岁小女儿戴珍珠耳钉

椰黄娱乐
2026-10-08 17:07:49
全红婵不对劲,不是她以后不比赛了,而是她今年19岁了,居然开始了自己的精致路线

全红婵不对劲,不是她以后不比赛了,而是她今年19岁了,居然开始了自己的精致路线

LULU生活家
2026-09-30 20:32:43
退训风波后首秀!41岁C罗斩第980球+获最高分 球迷展示巨型TIFO声援

退训风波后首秀!41岁C罗斩第980球+获最高分 球迷展示巨型TIFO声援

我爱英超
2026-10-10 06:49:30
浙江一30岁男子在ICU抢救,母亲取不出儿子存款救命,银行:家属须出具法定监护人身份证明,母亲前往法院申请成为儿子监护人

浙江一30岁男子在ICU抢救,母亲取不出儿子存款救命,银行:家属须出具法定监护人身份证明,母亲前往法院申请成为儿子监护人

大风新闻
2026-10-10 09:55:03
0-2!斯瓦泰克爆冷!中网4强全出炉,对阵+赛程如下,郑钦文利好

0-2!斯瓦泰克爆冷!中网4强全出炉,对阵+赛程如下,郑钦文利好

大秦壁虎白话体育
2026-10-09 21:03:45
缅北保护伞终于撑不住了!敏昂莱6月访华,中方直接把压力顶上去

缅北保护伞终于撑不住了!敏昂莱6月访华,中方直接把压力顶上去

云上乌托邦
2026-10-09 19:06:54
公安部多次提醒:卖掉旧手机,不只是丢自己隐私,孩子也会受牵连

公安部多次提醒:卖掉旧手机,不只是丢自己隐私,孩子也会受牵连

你在偷看谁
2026-10-08 19:57:01
开始清算!警方通报王皓事件处理结果,3人被拘,樊振东说得没错

开始清算!警方通报王皓事件处理结果,3人被拘,樊振东说得没错

凡知
2026-10-10 12:44:31
马云现身NBA中国赛澳门站,与成龙、贝克汉姆、蔡崇信同框观赛

马云现身NBA中国赛澳门站,与成龙、贝克汉姆、蔡崇信同框观赛

三言科技
2026-10-10 10:00:09
北京大学发布讣告:楼宇烈先生逝世是中国学界的重大损失

北京大学发布讣告:楼宇烈先生逝世是中国学界的重大损失

澎湃新闻
2026-10-10 09:44:12
2026-10-10 13:47:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14167文章数 142748关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

给李克勤救场的草根歌手侯浪将开个唱:这次演唱3小时

头条要闻

给李克勤救场的草根歌手侯浪将开个唱:这次演唱3小时

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

王仁君获飞天视帝,赵丽颖发文祝贺

财经要闻

蹭尊界流量?岚图汽车在“玩火”

汽车要闻

老车主请回避 2026款理想i6升级都是你想要的

态度原创

艺术
本地
房产
手机
公开课

艺术要闻

21幅 野兽派创始人‌ 马蒂斯作品集二

本地新闻

踏访沙县第一村,寻国民小吃本源

房产要闻

475万人,猛增13.1%!国庆海南,又爆了?

手机要闻

一加16重磅爆料!联合京东方第四代东方屏,支持185Hz 高刷

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版