网易首页 > 网易号 > 正文 申请入驻

谷歌RSI论文:AI自进化,做梦吧!

0
分享至

鱼羊 发自 凹非寺
量子位 | 公众号 QbitAI

有意思,谷歌刚被曝跑通了RSI,一篇关于如何让AI实现自我进化的论文,就被官方发到了网上。

打开方式还挺别致,“做梦”。



对,没让大模型重新训练自己,也不是让AI直接修改自己的权重,而是Dream-RSI,直接就是一个“梦中学”。

不开玩笑,咱还是正经说,其实是研究人员们发现了一个有点妙的事情:

AI真实探索留存下的历史记录,本身就是一个模拟世界。

于是,一次昂贵的真实探索结束后,Agent不必真的重新跑上几百、几千遍实验,就可以在过去已经发生过的搜索树里,进行虚拟推演(做梦),反复试验新的搜索策略。

等找到更好的策略,再回到真实环境里跑一次。

新的探索,又会产生一张更大的搜索树。

再拿来“做梦”。

如此循环。



省了一大笔钱不说,这法子还真的管用。在算法工程、数学优化和GPU内核工程三类任务上,研究人员都证明,Dream‑RSI不仅能大幅降低探索的计算成本,还能达到甚至超越原有方案的发现效果。

历史就是世界

一起来细扒一下论文。

论文的核心思路可以这样总结:把AI走过的弯路,变成AI新的训练场。

谷歌的研究人员认为,RSI的核心驱动力,其实在于高效探索。因此如何管控并优化探索策略,是一个非常关键的问题。

实际上,很多AI科研系统都已经实现了一个Loop:

生成一个方案 → 跑实验 → 看结果 → 修改方案 → 再跑实验。

问题是,随着搜索空间的不断扩大,固定的探索策略无法自适应调整;而在线策略优化,又存在迭代时间长、反馈滞后、代价高等等困境。

Dream-RSI抓住了一个此前没有被充分利用的东西:历史。



一次Agent探索任务跑下来,其实会留下非常丰富的记录,形成一棵发现树(Discovery Tree)。

be like:

root / | \ A B C | | | A1 B1 C1 | | A2 C2

谷歌的研究人员换了个视角,发现这一堆历史日志,不就是一个模拟器嘛!

举个例子,Agent首次执行的策略,是把A、B、C分支依次都跑一遍,跑完之后每个节点的结果其实都存下来了:A1得多少分、B1会不会报错、C2效果怎样、各自花了多少计算量。

现在,我们换一种搜索策略,比如:先跑C,如果C1不够好,再走A。

从头再跑一遍?大可不必,因为C、C1、A、A1这些结果都可以直接调用,只要让新策略在旧树上“重新走一遍”,就能算出,“如果当时这么做,需要花费多少计算量,能达到什么效果”。



也就是说,在Agent已经探索过的区域里,历史就是世界。

只需要一次真实的执行,大量新的策略探索都能更低成本地在这个“模拟世界”中被验证。

在梦中自我进化

整个Dream-RSI系统分为三步。

第一步,真实探索。

当前探索策略控制一个Coding Agent,决定开哪些分支、继续哪些方案、跑多少个并行任务、什么时候结束。

所有过程被记录为一棵发现树。

第二步,开始做梦。

引入另一个大语言模型来负责开发探索策略。

每生成一种新的探索方案,不重新跑实验,而是在过去积累的所有发现树上“回放”结果。

最终,综合考虑答案质量、搜索成本和并行效率,找出更好的动态策略。

第三步,把赢家重新派出去。**

新策略进入真实环境,指挥下一轮探索。

由于策略已经变化,它可能会走到上一代Agent没有抵达过的位置。

这样就会产生新的发现树,继续扩大下一轮的“梦境”。

也就是:

真实探索 → 产生更多历史 → 历史变成更多模拟世界 → 在模拟世界中优化探索策略 → 更好的策略产生新的历史……

大幅降低计算成本,效果不降反增

研究团队把Dream-RSI扔到了8个发现任务里,横跨三个方向:算法工程、数学优化和GPU Kernel优化。

最直接的对照组叫Recursive Fixed Exploration

它和Dream-RSI使用相同模型、相同Evaluator、相同初始策略和资源约束。

不同在于,一个每轮都会学习如何重新组织探索,另一个永远按照第一轮的固定策略继续搜索。

算法工程

研究团队让Agent优化Lasso regularization path

当模型为Gemini 3.1 Pro时,固定探索最终消耗550次Agent调用,六个测试数据集平均运行时间3587.1ms。

Dream-RSI则用了317次调用,最终做到2931.0ms。

换成Gemini 3.7 Flash也是类似:

固定策略用了3200次Agent调用,平均耗时2516.7ms;Dream-RSI用了1879次,耗时降到2350.6ms。



跟SimpleTES的对比结果差距更夸张。

SimpleTES对应实验预算达到51200次调用。Dream-RSI在部分设置下则只需几百次调用。

两者最高能差出去162倍

GPU Kernel

在VGG16和LayerNorm任务上,Dream-RSI分别相差2.43倍1.79倍的生成次数,做到相近性能。

在ConvDiv和ConvMax中,则在接近的计算预算下,把性能分别提高2.09倍1.44倍



数学优化



在Sum Difference上,Dream-RSI拿到1.145427,高于论文列出的多个基线;Circle Packing打到2.635983。

但Auto Correlation中,SimpleTES仍然是SOTA。不过Dream-RSI在结果相近的情况下,调用量做到了1000 vs 51200。

One More Thing

有意思的一点是,研究人员们还发现,给AI总结“经验教训”,结果反而更差了。



他们把之前探索中踩的坑直接塞进下一轮Prompt,结果万万没想到:

加了显式语义指导以后,不管是固定探索还是Dream-RSI,表现反而普遍下降了。

论文给出的解释是:

长程科研搜索往往同时存在很多并行路线。

如果过早去总结“高层结论”,就相当于提前给未来的探索加上了很强的先验。

结果可能不是少走弯路,而是直接把一些看起来没希望、实际上可能有价值的路线堵死了。

最后,做个小小的总结,实际上,在Dream-RSI的整个实验里,模型本身没有被重新训练,与其说是模型的自进化,更像是Harness的自进化。

过去我们谈Agent自进化,关注最多的是两件事:一、把成功经验写进Memory;二、把历史数据重新拿去训练模型。

Dream-RSI提供了第三条路:

模型可以不变,知识甚至不用先总结成文字,先让「寻找知识的方法」自己进化。

下一代Agent不必只从上一代留下的“答案”里学习。

而是学习:

上一代到底是怎么找到答案的,以及——有没有一种更好的找法。

论文由Google、Google DeepMind、马里兰大学和弗吉尼亚大学研究者共同完成,目前论文、项目页和代码仓库均已公开。

项目地址:
https://dream-rsi.com/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
住建部放话了,楼龄满25年的房子,全按新规处理,这几类业主或将发财

住建部放话了,楼龄满25年的房子,全按新规处理,这几类业主或将发财

巢客HOME
2026-09-17 04:10:03
北京新增一座“公园式”大商场!近30个“首店”入驻,地铁出站即达…9月26日开业

北京新增一座“公园式”大商场!近30个“首店”入驻,地铁出站即达…9月26日开业

北京商报
2026-09-17 08:35:10
本·拉登藏了9年都没被发现!5米高墙加铁丝网严防死守,没想到最后因晾衣绳上13件长袍和4条尿布暴露

本·拉登藏了9年都没被发现!5米高墙加铁丝网严防死守,没想到最后因晾衣绳上13件长袍和4条尿布暴露

磊子讲史
2026-09-14 17:39:07
何意味?马杜埃凯清空了社媒,仅保留阿森纳、英格兰队的标签

何意味?马杜埃凯清空了社媒,仅保留阿森纳、英格兰队的标签

懂球帝
2026-09-17 13:27:04
泰勒·斯威夫特突袭艾美奖:全组签保密协议,拍完还给演员发饼干

泰勒·斯威夫特突袭艾美奖:全组签保密协议,拍完还给演员发饼干

娱圈观察员
2026-09-16 10:09:11
王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

ETtoday星光云
2026-09-17 13:51:01
重要涉密单位外包保洁员段某主动联系境外间谍,盗取偷拍出卖3项国家秘密6项情报,获利13万元,被判10年,11名责任人被处分

重要涉密单位外包保洁员段某主动联系境外间谍,盗取偷拍出卖3项国家秘密6项情报,获利13万元,被判10年,11名责任人被处分

扬子晚报
2026-09-17 07:55:15
28岁女演员突发心脏骤停成植物人,昏迷3个月后苏醒,如今重回横店连跑8家剧组求职:我不躺平,我还可以工作……

28岁女演员突发心脏骤停成植物人,昏迷3个月后苏醒,如今重回横店连跑8家剧组求职:我不躺平,我还可以工作……

都市快报橙柿互动
2026-09-17 00:19:01
留美1年变壮了!中国男篮19岁2米06新星蜕变:效力NCAA名校,化身魔鬼筋肉人

留美1年变壮了!中国男篮19岁2米06新星蜕变:效力NCAA名校,化身魔鬼筋肉人

李喜林篮球绝杀
2026-09-17 11:59:23
奥运冠军杨扬现状:51岁依然很美,嫁美国人,儿女双全定居上海

奥运冠军杨扬现状:51岁依然很美,嫁美国人,儿女双全定居上海

大西体育
2026-09-17 09:54:59
9月17日最新消息!苦等的2026退休养老金,究竟会不会涨?

9月17日最新消息!苦等的2026退休养老金,究竟会不会涨?

妙知
2026-09-17 10:06:04
俄罗斯咬死250美元等中国低头,中方转身跟美国签了20年

俄罗斯咬死250美元等中国低头,中方转身跟美国签了20年

安安说
2026-09-17 10:12:44
拿着5亿大单却找不到供应商:中国车企的价格战,把零件厂榨干了

拿着5亿大单却找不到供应商:中国车企的价格战,把零件厂榨干了

时尚的弄潮
2026-09-17 04:06:37
北美足联冠军杯夺冠,迈阿密国际荣获队史第四座冠军奖杯

北美足联冠军杯夺冠,迈阿密国际荣获队史第四座冠军奖杯

懂球帝
2026-09-17 10:22:10
仁爱礁传来好消息!菲律宾国防部:坐滩登陆舰的状况正在迅速恶化

仁爱礁传来好消息!菲律宾国防部:坐滩登陆舰的状况正在迅速恶化

孤城落叶
2026-09-16 20:16:21
江苏物业收费新规公布

江苏物业收费新规公布

江南晚报
2026-09-17 09:28:51
1967年张治中写信请求“释放”彭总,却被周总理驳回:以后别写了!

1967年张治中写信请求“释放”彭总,却被周总理驳回:以后别写了!

凉州辞
2026-09-17 06:45:03
沙特球迷意难平!不仅因为78-87惜败中国男篮,更在于以下5点

沙特球迷意难平!不仅因为78-87惜败中国男篮,更在于以下5点

林子说事
2026-09-17 05:38:59
为在离婚时多分财产,上海一女子连偷超市6次涉案金额超4000元,到案后自称:想通过盗窃“证明”自己没钱

为在离婚时多分财产,上海一女子连偷超市6次涉案金额超4000元,到案后自称:想通过盗窃“证明”自己没钱

扬子晚报
2026-09-17 10:48:23
30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

三农雷哥
2026-09-05 12:16:13
2026-09-17 14:35:00
量子位 incentive-icons
量子位
追踪人工智能动态
13334文章数 176564关注度
往期回顾 全部

科技要闻

赛力斯全面接盘,华为真的“撤”了吗?

头条要闻

倪萍发长文追忆敬一丹:敬大姐 跟你说一声对不起

头条要闻

倪萍发长文追忆敬一丹:敬大姐 跟你说一声对不起

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

比起敬一丹的退而不休 章伟秋更显明智

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

本地
家居
旅游
手机
亲子

本地新闻

不止胖东来!许昌藏着半部三国史

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

奔“县”游|来这里,捡一筐牛粪,烧一锅传统奶食!

手机要闻

苹果防诈骗升级!iOS27 新增冒充风险检测,专克各种冒充诈骗

亲子要闻

惹事包又打翻牛奶了~看着他手足无措的小表情,到底该先安慰还是先批评呢?

无障碍浏览 进入关怀版