网易首页 > 网易号 > 正文 申请入驻

谷歌DeepMind研究员宣称Gemini 4已实现RSI!

0
分享至


新智元报道


RSI来了!

我们的模型正式超越了我。我已经没什么能再教它的了。是时候去追寻我的咖啡师梦想啦 :)☕

说出这番话的人,是Google DeepMind研究员 Zirui Wang。

他的履历从CMU到Apple Foundation Models再到xAI,最后落脚DeepMind,妥妥的AI圈「六边形战士」。



一个亲手调教模型长大的研究员,公开说出「我教不动它了」。

这到底是肺腑之言,还是精心设计的一波营销?

不管怎样,沉默了整整七个月的谷歌,带着Gemini 4 Argon杀回来了。

而且这一次,它绑定了一个现在最热词——RSI。

RSI,全称Recursive Self-Improvement,递归自我改进。AI自己改进自己,改进完的AI再改进自己,像滚雪球一样越滚越大。

哲学家David Chalmers早在2010年就给出了核心论断:智能的提升,必然带来设计更高智能系统的能力的提升。

这是一个自我加速的循环,一旦启动,理论上就不会停。

这也是为什么RSI被视为从AGI通往超级智能的「最后一块拼图」。同时也是整个AI安全领域最令人不安的话题。

因为一旦这个雪球真的滚起来了,人类还刹得住车吗?

所以当DeepMind研究员在社交媒体上大喊「RSI来了」的时候,半个AI圈都炸了。

Gemini 4 Argon在跑分层面确实交出了一份让竞争对手坐不住的成绩单。

独立评测机构Artificial Analysis给出的综合智能指数是53分,直接追平GPT-6 Astra,比上一代Gemini 3.1 Pro Preview飙升了23分。


更亮眼的是幻觉率——仅15%,是所有高分模型里最低的。对比之下,Astra的幻觉率高达51%,Sol是54%。换句话说,Argon不光聪明,还特别「实诚」,不瞎编。

在Vals Index这个涵盖金融、法律、编程、税务的综合知识工作榜上,Argon以68.9%登顶全部41个模型的第一。

这是Gemini系列有史以来第一次坐上这把交椅。

在金融Agent测试中拿到65.4%同样高居榜首,在Vibe Code Bench上也以91.91%紧咬Sonnet 5.5的92.39%,仅差半个身位。

而在Text Arena盲测中,Argon以1525的Elo分暂列第一,在代码编写、高难度提示词、创意写作等多个赛道都展现了压倒性优势。


这些数据放在一起看,至少说明一件事:谷歌不是回来「凑数」的。

但RSI的证据,到底在哪?

跑分归跑分,RSI归RSI。

Zirui Wang那条帖子让人激动,但「模型超越了我」和「模型能自主改进自己」之间,还差很远。

AlphaGo赢了李世石,并不代表AlphaGo能自己发明新的棋类游戏。

目前最接近RSI「实锤」的证据,来自谷歌的三个内部案例。

第一个:自主优化数据中心,释放300+TiB内存。

Argon组成的智能体团队,自主扫描谷歌全网的性能遥测数据,精准定位到了内存优化空间,并且自主提交修改代码。

上线后直接腾出了超过300 TiB内存,预计最终可达500 TiB到1 PiB。

在谷歌的体量下,这是千万美元级别的成本节约。

第二个:用Rust重写80万行C/C++系统内核。

搞底层开发的人都知道,动内核代码就像拆弹——一个指针错误,整个系统原地爆炸。

但Argon正在主导把谷歌底层代码(包括Fuchsia Zircon内核)从C/C++迁移到内存安全的Rust。

AI碰80万行内核代码,这件事本身就是一个里程碑。

第三个:手撕3.2万行SIMD底层指令,视频解码性能飙升2.7倍。

谷歌开源视频解码项目libgav1里有一段3.2万行的SIMD代码,人类工程师写起来都叫苦连天。

Argon通过多轮编译实验反复迭代,直接用安全Rust完成了重写,新版本速度是原Rust移植版的2.7倍,逼平了高度优化的C++版本,且逐帧输出完全一致。

这三个案例,说明Argon确实具备了在真实工程环境中「自主发现问题——自主设计方案——自主迭代优化」的能力。

这和传统的「人类写好提示词让AI干活」有本质区别——它开始自己找活干了。

但严格来说,这仍然是DeepMind所定义的「模型辅助训练优化」,而非完整的RSI闭环。

真正的RSI需要一个更强有力的证据:不只是模型能改进自己,而是改进后的模型,要比改进前更擅长改进自己。

也就是说「自我改进的能力」本身也在被改进,形成一个越转越快的飞轮。

DeepMind在九月中旬发布的Dream-RSI论文框架,提出让AI智能体通过「回放」历史探索来优化未来的搜索策略,在算法工程和GPU内核优化上都展现出了显著提升。


Google DeepMind开发者关系负责人Logan Kilpatrick也在播客中公开表示,他们已经观察到了「递归自我改进的早期迹象」。


所以更准确的判断可能是:我们正站在RSI的门槛上,已经能看见门里面的东西了。

但还没有迈进去。

跑分之外:真实世界的「照妖镜」

偏偏就在Argon发布的同一天,彭博社甩出了一记暗拳:谷歌内部并非铁板一块。


据报道,部分接触过内部评测的员工坦言,Argon跑分很漂亮,但真正干活时——尤其是前端设计之类的实际编程任务,表现「参差不齐」。

AI专家Edwin Chen直指行业通病「Benchmaxxing」:工程师们疯狂适配标准测试拿高分,却忽略了让模型真正好用。

独立评测数据也印证了这种担忧。

Argon在Terminal Bench 4上只拿到57%,落后Claude Sonnet 5.5的64%和Opus 5.5的60%。在Code Arena网页开发榜上排名第八,虽然进步了21名,但在最硬核的编程智能体战场上,Claude仍然是程序员的首选。

Hacker News上抢先体验过的用户给出的评价是:长程注意力很好、能把事做完,但打磨和稳定性差一截。任务一变大就容易封顶。

不过,对于谷歌来说,Argon还有一张王牌:价格。

百万输入Token仅2美元,输出Token 10美元,单任务综合成本1.99美元——只有GPT-6 Astra的六成,更是Claude Opus 5.5的三分之一。

手握全球最大TPU算力集群的谷歌打起价格战来,OpenAI和Anthropic确实难受。

再加上百万Token的输出上限(从前代的64K原地飞升到1M),这意味着AI终于不用在复杂推理到一半的时候「断气」了。

这种持续深度思考的能力,可能比任何单项跑分都更有长远意义。

三强鼎立:终局远未到来

Gemini 4 Argon并没有碾压所有对手,但它完成了一个更重要的任务——

把谷歌从「观众席」拉回了「牌桌」。

当前的AI前沿已经形成了清晰的三国杀格局:谷歌凭知识工作、超长上下文和网络安全防御守住了自己的地盘;OpenAI在科学推理和Agentic Coding上依旧领跑;Anthropic的Claude牢牢占据着硬核编程的高地。没

有绝对的霸主,只有交替领先的追逐赛。

而RSI这个让全行业既兴奋又恐惧的概念,可能确实在某个我们看不清的角落里,开始缓慢地转动它的齿轮了。

从DeepMind的Dream-RSI论文到Argon在工程实战中展现的自主迭代能力,种种迹象表明,AI「自己教自己」的那一天正在逼近。

只是,从「研究员教不动模型了」到「模型开始自己教自己」,这中间的距离,可能比我们想象的要远。也可能,比我们想象的要近。

毕竟,Argon只是Gemini 4的入门款。谷歌说,真正的大招还在后面。

至于Zirui Wang的咖啡师梦想☕ ——建议先别辞职。

万一下一代模型连拉花都会了呢?

参考资料:

https://x.com/ArtificialAnlys/status/2105392625788637299

https://www.bloomberg.com/news/articles/2026-09-30/google-grapples-with-employee-skepticism-about-new-gemini-model

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

编辑:所罗门

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
亚运会冷知识:6个亚洲国家不参加亚运会,反而加入欧洲体育体系

亚运会冷知识:6个亚洲国家不参加亚运会,反而加入欧洲体育体系

安海客
2026-10-01 05:29:30
国民党主席改选落幕!表面赢家是郑丽文,真正的赢家另有其人

国民党主席改选落幕!表面赢家是郑丽文,真正的赢家另有其人

呼呼历史论
2026-10-01 07:56:38
财政部部长蓝佛安:推进消费税征收环节后移并稳步下划地方、地方附加税改革等,支持地方拓展税源

财政部部长蓝佛安:推进消费税征收环节后移并稳步下划地方、地方附加税改革等,支持地方拓展税源

界面新闻
2026-10-01 13:02:49
林诗栋亚运三金王,妈妈面馆被挤爆:十八元一碗,竟有四块大排骨

林诗栋亚运三金王,妈妈面馆被挤爆:十八元一碗,竟有四块大排骨

观察鉴娱
2026-10-01 10:17:33
“我是毛主席的儿子,我有证据!”1993年,浙江杭州老人鞠涛声称自己是流落民间的“毛岸龙”

“我是毛主席的儿子,我有证据!”1993年,浙江杭州老人鞠涛声称自己是流落民间的“毛岸龙”

回京历史梦
2026-09-30 18:28:05
12亿造的世界最高佛,如今连水费都交不起!门票从199元跌到免费

12亿造的世界最高佛,如今连水费都交不起!门票从199元跌到免费

抽象派大师
2026-09-29 01:16:24
恭喜!中国男篮17岁2米16新星留美:曾夺U15冠军,1米94姐姐是女篮国手

恭喜!中国男篮17岁2米16新星留美:曾夺U15冠军,1米94姐姐是女篮国手

李喜林篮球绝杀
2026-09-30 19:52:05
西媒:葡足协本希望C罗世界杯后主动退出国家队

西媒:葡足协本希望C罗世界杯后主动退出国家队

体坛周报
2026-10-01 17:13:09
倒计时!杨瀚森可能离开开拓者了.....

倒计时!杨瀚森可能离开开拓者了.....

柚子说球
2026-10-01 19:37:24
易会满,受贿数额特别巨大

易会满,受贿数额特别巨大

新京报
2026-09-30 10:18:52
小鹏集团:某二级供应商员工捏造零部件产线不实信息,将依法追责

小鹏集团:某二级供应商员工捏造零部件产线不实信息,将依法追责

界面新闻
2026-10-01 10:43:46
拳王泰森来瞻仰毛主席遗容,他出来说了一句这辈子都没敢说的话

拳王泰森来瞻仰毛主席遗容,他出来说了一句这辈子都没敢说的话

游文刀
2026-09-30 00:14:51
赵本山落网后屋内搜出20吨黄金,暗中移民海外?私生活谣言太离谱

赵本山落网后屋内搜出20吨黄金,暗中移民海外?私生活谣言太离谱

秋姐居
2026-09-29 11:31:44
空姐跪地道歉细节曝光,大连理工大学博士还原真相,东航回应

空姐跪地道歉细节曝光,大连理工大学博士还原真相,东航回应

育学笔谈
2026-09-30 09:48:32
拉塞尔加盟上海遭嘲讽!两大NBA球星喊话:打CBA从来都不丢人

拉塞尔加盟上海遭嘲讽!两大NBA球星喊话:打CBA从来都不丢人

体育见习官
2026-10-01 15:39:39
目不识丁,出尽洋相?于和伟在金鹰奖上的发言,给内娱明星上了一课

目不识丁,出尽洋相?于和伟在金鹰奖上的发言,给内娱明星上了一课

乡野小珥
2026-10-01 00:01:04
今日重要赛事!10月1日,央视CCTV5、CCTV5+直播节目表

今日重要赛事!10月1日,央视CCTV5、CCTV5+直播节目表

薇说体育
2026-10-01 10:32:49
3-2,3-0亚运会男排4强产生3席,半决赛中国队迎来生死战

3-2,3-0亚运会男排4强产生3席,半决赛中国队迎来生死战

骚年先锋
2026-10-01 17:07:24
太憋屈!5块金牌,5张非洲脸:谁在羞辱亚洲体育?

太憋屈!5块金牌,5张非洲脸:谁在羞辱亚洲体育?

荆楚寰宇文枢
2026-09-30 22:26:52
公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

只要高兴就好
2026-09-24 11:58:50
2026-10-01 20:40:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16324文章数 67099关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

足够先进可以展示 191式自动步枪硬核开箱视频首次披露

头条要闻

足够先进可以展示 191式自动步枪硬核开箱视频首次披露

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

旅游
本地
亲子
时尚
公开课

旅游要闻

长风公园焕新开园,长风海洋世界明星企鹅茂茂迎来一岁派对

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

亲子要闻

开学一个月“学习困难门诊”迎就诊高峰,医生:就诊诉求几乎只有“提分”

在米兰,用时装唤醒内心的自我

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版