网易首页 > 网易号 > 正文 申请入驻

谷歌DeepMind研究员宣称Gemini 4已实现RSI!

0
分享至


新智元报道


RSI来了!

我们的模型正式超越了我。我已经没什么能再教它的了。是时候去追寻我的咖啡师梦想啦 :)☕

说出这番话的人,是Google DeepMind研究员 Zirui Wang。

他的履历从CMU到Apple Foundation Models再到xAI,最后落脚DeepMind,妥妥的AI圈「六边形战士」。



一个亲手调教模型长大的研究员,公开说出「我教不动它了」。

这到底是肺腑之言,还是精心设计的一波营销?

不管怎样,沉默了整整七个月的谷歌,带着Gemini 4 Argon杀回来了。

而且这一次,它绑定了一个现在最热词——RSI。

RSI,全称Recursive Self-Improvement,递归自我改进。AI自己改进自己,改进完的AI再改进自己,像滚雪球一样越滚越大。

哲学家David Chalmers早在2010年就给出了核心论断:智能的提升,必然带来设计更高智能系统的能力的提升。

这是一个自我加速的循环,一旦启动,理论上就不会停。

这也是为什么RSI被视为从AGI通往超级智能的「最后一块拼图」。同时也是整个AI安全领域最令人不安的话题。

因为一旦这个雪球真的滚起来了,人类还刹得住车吗?

所以当DeepMind研究员在社交媒体上大喊「RSI来了」的时候,半个AI圈都炸了。

Gemini 4 Argon在跑分层面确实交出了一份让竞争对手坐不住的成绩单。

独立评测机构Artificial Analysis给出的综合智能指数是53分,直接追平GPT-6 Astra,比上一代Gemini 3.1 Pro Preview飙升了23分。


更亮眼的是幻觉率——仅15%,是所有高分模型里最低的。对比之下,Astra的幻觉率高达51%,Sol是54%。换句话说,Argon不光聪明,还特别「实诚」,不瞎编。

在Vals Index这个涵盖金融、法律、编程、税务的综合知识工作榜上,Argon以68.9%登顶全部41个模型的第一。

这是Gemini系列有史以来第一次坐上这把交椅。

在金融Agent测试中拿到65.4%同样高居榜首,在Vibe Code Bench上也以91.91%紧咬Sonnet 5.5的92.39%,仅差半个身位。

而在Text Arena盲测中,Argon以1525的Elo分暂列第一,在代码编写、高难度提示词、创意写作等多个赛道都展现了压倒性优势。


这些数据放在一起看,至少说明一件事:谷歌不是回来「凑数」的。

但RSI的证据,到底在哪?

跑分归跑分,RSI归RSI。

Zirui Wang那条帖子让人激动,但「模型超越了我」和「模型能自主改进自己」之间,还差很远。

AlphaGo赢了李世石,并不代表AlphaGo能自己发明新的棋类游戏。

目前最接近RSI「实锤」的证据,来自谷歌的三个内部案例。

第一个:自主优化数据中心,释放300+TiB内存。

Argon组成的智能体团队,自主扫描谷歌全网的性能遥测数据,精准定位到了内存优化空间,并且自主提交修改代码。

上线后直接腾出了超过300 TiB内存,预计最终可达500 TiB到1 PiB。

在谷歌的体量下,这是千万美元级别的成本节约。

第二个:用Rust重写80万行C/C++系统内核。

搞底层开发的人都知道,动内核代码就像拆弹——一个指针错误,整个系统原地爆炸。

但Argon正在主导把谷歌底层代码(包括Fuchsia Zircon内核)从C/C++迁移到内存安全的Rust。

AI碰80万行内核代码,这件事本身就是一个里程碑。

第三个:手撕3.2万行SIMD底层指令,视频解码性能飙升2.7倍。

谷歌开源视频解码项目libgav1里有一段3.2万行的SIMD代码,人类工程师写起来都叫苦连天。

Argon通过多轮编译实验反复迭代,直接用安全Rust完成了重写,新版本速度是原Rust移植版的2.7倍,逼平了高度优化的C++版本,且逐帧输出完全一致。

这三个案例,说明Argon确实具备了在真实工程环境中「自主发现问题——自主设计方案——自主迭代优化」的能力。

这和传统的「人类写好提示词让AI干活」有本质区别——它开始自己找活干了。

但严格来说,这仍然是DeepMind所定义的「模型辅助训练优化」,而非完整的RSI闭环。

真正的RSI需要一个更强有力的证据:不只是模型能改进自己,而是改进后的模型,要比改进前更擅长改进自己。

也就是说「自我改进的能力」本身也在被改进,形成一个越转越快的飞轮。

DeepMind在九月中旬发布的Dream-RSI论文框架,提出让AI智能体通过「回放」历史探索来优化未来的搜索策略,在算法工程和GPU内核优化上都展现出了显著提升。


Google DeepMind开发者关系负责人Logan Kilpatrick也在播客中公开表示,他们已经观察到了「递归自我改进的早期迹象」。


所以更准确的判断可能是:我们正站在RSI的门槛上,已经能看见门里面的东西了。

但还没有迈进去。

跑分之外:真实世界的「照妖镜」

偏偏就在Argon发布的同一天,彭博社甩出了一记暗拳:谷歌内部并非铁板一块。


据报道,部分接触过内部评测的员工坦言,Argon跑分很漂亮,但真正干活时——尤其是前端设计之类的实际编程任务,表现「参差不齐」。

AI专家Edwin Chen直指行业通病「Benchmaxxing」:工程师们疯狂适配标准测试拿高分,却忽略了让模型真正好用。

独立评测数据也印证了这种担忧。

Argon在Terminal Bench 4上只拿到57%,落后Claude Sonnet 5.5的64%和Opus 5.5的60%。在Code Arena网页开发榜上排名第八,虽然进步了21名,但在最硬核的编程智能体战场上,Claude仍然是程序员的首选。

Hacker News上抢先体验过的用户给出的评价是:长程注意力很好、能把事做完,但打磨和稳定性差一截。任务一变大就容易封顶。

不过,对于谷歌来说,Argon还有一张王牌:价格。

百万输入Token仅2美元,输出Token 10美元,单任务综合成本1.99美元——只有GPT-6 Astra的六成,更是Claude Opus 5.5的三分之一。

手握全球最大TPU算力集群的谷歌打起价格战来,OpenAI和Anthropic确实难受。

再加上百万Token的输出上限(从前代的64K原地飞升到1M),这意味着AI终于不用在复杂推理到一半的时候「断气」了。

这种持续深度思考的能力,可能比任何单项跑分都更有长远意义。

三强鼎立:终局远未到来

Gemini 4 Argon并没有碾压所有对手,但它完成了一个更重要的任务——

把谷歌从「观众席」拉回了「牌桌」。

当前的AI前沿已经形成了清晰的三国杀格局:谷歌凭知识工作、超长上下文和网络安全防御守住了自己的地盘;OpenAI在科学推理和Agentic Coding上依旧领跑;Anthropic的Claude牢牢占据着硬核编程的高地。没

有绝对的霸主,只有交替领先的追逐赛。

而RSI这个让全行业既兴奋又恐惧的概念,可能确实在某个我们看不清的角落里,开始缓慢地转动它的齿轮了。

从DeepMind的Dream-RSI论文到Argon在工程实战中展现的自主迭代能力,种种迹象表明,AI「自己教自己」的那一天正在逼近。

只是,从「研究员教不动模型了」到「模型开始自己教自己」,这中间的距离,可能比我们想象的要远。也可能,比我们想象的要近。

毕竟,Argon只是Gemini 4的入门款。谷歌说,真正的大招还在后面。

至于Zirui Wang的咖啡师梦想☕ ——建议先别辞职。

万一下一代模型连拉花都会了呢?

参考资料:

https://x.com/ArtificialAnlys/status/2105392625788637299

https://www.bloomberg.com/news/articles/2026-09-30/google-grapples-with-employee-skepticism-about-new-gemini-model

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

编辑:所罗门

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
0-1!中国U16“输的窝囊”,战术不行,配合不行,球迷高喊下课

0-1!中国U16“输的窝囊”,战术不行,配合不行,球迷高喊下课

汪星人哟
2026-09-30 21:41:50
上海52岁炒股冠军罕见发声:目前A股想逢低建仓,建议只磕123原则

上海52岁炒股冠军罕见发声:目前A股想逢低建仓,建议只磕123原则

股经纵横谈
2026-10-01 17:25:48
中国0-1澳大利亚夺季军,越南垫底,踢的如此混乱跟换大卫有关系

中国0-1澳大利亚夺季军,越南垫底,踢的如此混乱跟换大卫有关系

暗香暗香
2026-09-30 23:34:55
国行苹果重磅新功能过审!终于要来了

国行苹果重磅新功能过审!终于要来了

花果科技
2026-09-30 14:30:02
徐向前晚年透露终极秘史:若无西安事变,红军早已开启第二次长征

徐向前晚年透露终极秘史:若无西安事变,红军早已开启第二次长征

纪史行者
2026-10-01 06:40:10
毛主席严厉批评彭雪枫搞“山头主义”,双方当场激烈交锋,彭雪枫拍案而起,高声回敬:“只有山头,没有主义。”

毛主席严厉批评彭雪枫搞“山头主义”,双方当场激烈交锋,彭雪枫拍案而起,高声回敬:“只有山头,没有主义。”

人生录
2026-09-30 14:26:34
哈马斯高级官员叛变——提供详细情报协助以色列击毙哈马斯5名旅长中的3名,

哈马斯高级官员叛变——提供详细情报协助以色列击毙哈马斯5名旅长中的3名,

老王说正义
2026-10-01 01:55:40
两轮加枪惜败!中国选手苏连博凡获男子25米手枪速射银牌

两轮加枪惜败!中国选手苏连博凡获男子25米手枪速射银牌

林子说事
2026-10-01 18:31:33
好奇查了一下陈妤颉的父亲,不查不知道,一查挺意外

好奇查了一下陈妤颉的父亲,不查不知道,一查挺意外

李博世财经
2026-10-01 09:35:29
难道说?摩根转发C罗社媒:Wow..

难道说?摩根转发C罗社媒:Wow..

懂球帝
2026-10-01 05:00:59
我不是御姐,我只是性感一点罢了

我不是御姐,我只是性感一点罢了

疾跑的小蜗牛
2026-10-01 20:25:40
第八轮中央巡视组即将进驻!很多人还搞不懂,巡视组到底有什么用

第八轮中央巡视组即将进驻!很多人还搞不懂,巡视组到底有什么用

职场资深秘书
2026-10-01 12:35:41
成本仅3000万,票房破5亿?陈思诚都压不住,这才是国庆档大黑马

成本仅3000万,票房破5亿?陈思诚都压不住,这才是国庆档大黑马

靠谱电影君
2026-09-29 17:18:16
亚运最新金牌榜!中国队151枚高居第1,还有多少冲金点?

亚运最新金牌榜!中国队151枚高居第1,还有多少冲金点?

刘笤说体坛
2026-10-01 10:16:12
中国为什么愿意长期帮老挝?说白了,中国愿意帮它

中国为什么愿意长期帮老挝?说白了,中国愿意帮它

果妈聊娱乐
2026-10-01 12:09:17
美媒:波音拿下美国海军6代机合同,没有鸭翼,美国2款6代机,全由波音公司制造

美媒:波音拿下美国海军6代机合同,没有鸭翼,美国2款6代机,全由波音公司制造

蓝星杂谈
2026-09-30 10:21:21
国台办:中国共产党鲜明提出收复台湾的主张,支持和推动了台湾光复运动

国台办:中国共产党鲜明提出收复台湾的主张,支持和推动了台湾光复运动

京彩台湾
2026-09-30 22:15:05
曝23岁张本智和长期勾引女性:自称年收入1亿日元 喝酒后爱爆粗口

曝23岁张本智和长期勾引女性:自称年收入1亿日元 喝酒后爱爆粗口

风过乡
2026-09-30 17:00:16
夺冠仅6天,迎1大噩耗!全家为日本效力的张本智和,终究自食恶果

夺冠仅6天,迎1大噩耗!全家为日本效力的张本智和,终究自食恶果

阿讯说天下
2026-10-01 04:14:27
进价6元/米 卖60元/米!燃气公司强制搭售波纹管 不买就停气

进价6元/米 卖60元/米!燃气公司强制搭售波纹管 不买就停气

闪电新闻
2026-09-30 12:52:42
2026-10-01 21:44:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16324文章数 67098关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

美最刺激过山车永久关闭:超百人称乘坐后脑损伤

头条要闻

美最刺激过山车永久关闭:超百人称乘坐后脑损伤

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

健康
教育
时尚
家居
本地

刷酸祛痘,为什么有人翻车?

教育要闻

@高三生 十月已至,这些高考大事将启动

在米兰,用时装唤醒内心的自我

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版