网易首页 > 网易号 > 正文 申请入驻

GPT-6 Astra开始参与下一代模型训练,OpenAI推动RSI走向现实!

0
分享至

智猩猩AI整理

编辑:林夕

“AGI has arrived。”

刚刚,英伟达CEO黄仁勋在X上评论OpenAI最新模型Astra,直接甩出了这句相当重量级的判断。


从ChatGPT到o1,再到Astra,黄仁勋认为,OpenAI用了4年走到了AGI时代。与此同时,他还透露,接下来将有40万块GPU上线。

这个判断当然引发了争议。

毕竟,AGI至今没有一个所有人都认可的统一标准

有人认为Astra已经足够接近,也有人认为现在宣布AGI到来仍然为时过早。

就连OpenAI自己,对AGI的定义也一直比较宽泛,Astra究竟是不是AGI,短时间内恐怕很难形成共识。

就在黄仁勋发出这句判断的当天,OpenAI也公布了内部AI研究工作的最新进展

截至8月中旬,OpenAI研究组织每天使用的Agent工作量,已经达到人类研究员工作量的3.1倍


而在另一篇文章里,OpenAI首席科学家Jakub Pachocki更是直接谈到了Recursive Self-Improvement,也就是递归自我改进。


如果说AGI讨论的是AI究竟有多聪明,那么RSI讨论的,则是一个更进一步的问题:

当AI足够聪明之后,它能不能反过来帮助人类训练更强的AI,甚至参与训练自己的下一代?

OpenAI这次释放的信号,正是这个方向正在从概念讨论逐渐走向现实。

01

Agent工作量超越人类:

3.1倍背后的研发范式转移

OpenAI这次披露的数据非常直接。

截至今年8月中旬,OpenAI内部研究组织每天使用的Agent工作量,相当于3.1个研究员工作日。


也就是说,按照一个标准8小时工作日计算,研究组织每天产生的Agent工作量,已经超过人类研究员工作量的3倍。

研究员可以同时启动多个Agent,让它们并行处理代码、实验和技术问题,自己则把更多时间放在研究方向、实验设计和最终判断上。

OpenAI披露的另一个变化也很值得注意。

2026年以来,每名活跃研究人员对应的实验数量持续增加,今年8月更是达到了自2025年1月开始统计以来的最高水平。


当然,人类并没有退出这个循环

OpenAI数据显示,在过去6个月里,成功完成的4到8小时任务中,超过一半至少出现过一次人工干预。


这说明目前的状态仍然不是AI自己做研究,人类完全不管

更接近现实的情况是,人类负责提出问题、设定目标和做最终判断,Agent则不断扩大执行层面的工作量。

这种工作方式也正在催生一个新的变化,OpenAI已经开始把自动化AI研究当成一个明确的研发目标。

与此同时,OpenAI公布了一项新的进展,去年提出的自动化AI研究实习生目标,现在已经完成。


这个系统可以在人类指导下,完成一些原本需要熟练研究员花费几天时间才能完成的研究任务。

按照OpenAI给出的定义,它可以在人类指导下完成一些明确的研究任务,而这些任务原本可能需要熟练研究员花上几天时间才能完成。

更关键的是,这不是终点。

OpenAI给出的下一阶段目标,是继续推进自动化AI研究员,目前的计划节点是2028年3月。


02

RSI从概念走进现实:

前代模型开始训练后代

Astra发布时,OpenAI研究训练副总裁Aidan Clark提到,这是OpenAI第一个在训练过程中大量使用前代模型进行监督的模型,并将其与递归自我改进联系起来。


按照目前披露的信息,GPT-5.6 Sol协助训练了Astra,Astra又进一步参与了Doug和Bel等后续模型的研发,而更强的预训练模型Doug,如今也正在参与训练自己的继任者。


如果这条链路最终被更多信息证实,那么OpenAI正在做的就不只是用AI辅助研发AI,而是在把上一代模型接入下一代模型的训练过程,让模型能力本身成为模型迭代的一部分。

这就是递归自我改进,也就是RSI正在变得越来越具体的地方。

CEO Sam Altman最早是在2025年10月的一次直播里提出这两个时间点的,彼时他说这是"我们研究计划的核心方向",之后又在 X 帖子中公开了这两个内部目标:


OpenAI首席科学家Jakub Pachocki却在最新文章《An Alien Mind》中提醒,人类可能还没有准备好迎接机器智能继续快速发展的后果


他已经直接谈到了“machine recursive self-improvement”。

Pachocki认为,越来越多的AI模型正在参与自身发展的过程,这种AI-on-AI的发展方式可能进一步加速AI进步;


真正困难的是在做到之后,如何继续让人类参与其中,并确保未来仍然掌握在人类手里。


这其实是一种非常微妙的状态。

OpenAI一边在踩油门,一边又提醒自己,车速可能已经太快了。

就在不久前,智谱创始人唐杰谈到下一代模型GLM-6时,给出的关键词就是:Full Self-Training。

按照唐杰的定义,GLM-6希望让模型覆盖预训练、中训练和后训练,并进一步具备自主训练和自我进化能力。

而在相关解读中,唐杰直接将这一方向与海外所说的RSI联系起来。

两条技术路线不尽相同,但关注的命题已高度重合:AI能不能开始参与AI的制造?

03

Astra之后真正值得盯的

不是一句“AGI来了”

黄仁勋说“AGI has arrived”,当然会成为这轮讨论里最吸睛的一句话。

但对AI行业来说,OpenAI这次披露的意义是第一次把一套更完整的AI参与AI研发的路径摆到了公开讨论中。

这意味着,下一轮模型竞争可能不只是比参数、Benchmark和推理能力。

谁能让AI更早、更稳定地参与数据处理、代码开发、实验设计、模型训练和安全研究,谁就可能获得更快的研发循环。

OpenAI现在公开讨论的,实际上正是这个循环能不能继续往前跑。

而它最终会不会真的形成完整RSI,OpenAI自己给出的答案仍然是:还不知道。

但至少从现在开始,RSI已经不再只是一个遥远的理论概念,而正在变成OpenAI公开承认、持续投入,并且已经出现早期实验结果的研发方向。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
西安2172户被害人灵魂之问,“我们1.34亿元去了哪里”?

西安2172户被害人灵魂之问,“我们1.34亿元去了哪里”?

记录刘杰
2026-09-12 22:42:47
热刺4轮不胜0进球,德泽尔比承认球员身体状态不佳

热刺4轮不胜0进球,德泽尔比承认球员身体状态不佳

足球推文C
2026-09-13 11:09:08
给胖东来供货十七年的牟强说,这里一边是天堂,一边是地狱。天堂是账期短,货款七天左右就能到账,地狱则是...

给胖东来供货十七年的牟强说,这里一边是天堂,一边是地狱。天堂是账期短,货款七天左右就能到账,地狱则是...

LULU生活家
2026-09-07 20:11:19
长大后才发现,语文课本里全是人生,网友:终是山猪品不了细糠

长大后才发现,语文课本里全是人生,网友:终是山猪品不了细糠

夜深爱杂谈
2026-09-11 22:40:21
评论员波利-里洪:皇马不会踢球,穆帅不想控球

评论员波利-里洪:皇马不会踢球,穆帅不想控球

懂球帝
2026-09-13 08:55:54
穆里尼奥妙手激活!皇马 5000 万水货蜕变!独造两球硬刚巴萨争冠

穆里尼奥妙手激活!皇马 5000 万水货蜕变!独造两球硬刚巴萨争冠

澜归序
2026-09-13 08:36:42
中国首次以武力威慑美国!特朗普批准对台军售,中方那就用最直接的方式作出有力回应!中国海军在台湾周边空域驱离美军军机

中国首次以武力威慑美国!特朗普批准对台军售,中方那就用最直接的方式作出有力回应!中国海军在台湾周边空域驱离美军军机

暮雨清歌u
2026-09-11 16:39:35
凌晨4点,50余人身穿白衣排队夜行,村中老人:看了你也得加入

凌晨4点,50余人身穿白衣排队夜行,村中老人:看了你也得加入

古怪奇谈录
2025-07-12 17:31:32
换帅如换刀!广东队小将从坐板凳,今成大腿,得分全队第一

换帅如换刀!广东队小将从坐板凳,今成大腿,得分全队第一

体育哲人
2026-09-13 10:33:58
郑佩佩自传谈及许晴向她宣泄情绪,坦言最难以理解的人便是许晴

郑佩佩自传谈及许晴向她宣泄情绪,坦言最难以理解的人便是许晴

情感大头说说
2026-09-12 11:00:28
4岁男童事件撕开法治假象:最荒诞的不是冲突本身,是全民对错倒置

4岁男童事件撕开法治假象:最荒诞的不是冲突本身,是全民对错倒置

浪子说
2026-09-12 00:40:03
新加坡不忍了!不到两天多名高管发声,印度彻底点燃新加坡人怒火

新加坡不忍了!不到两天多名高管发声,印度彻底点燃新加坡人怒火

奇思妙想生活家
2026-09-12 13:34:51
15名同事合买彩票,中奖3000万港元,因负责购票者不愿平分奖金闹翻…

15名同事合买彩票,中奖3000万港元,因负责购票者不愿平分奖金闹翻…

云南网络广播电视台
2026-09-12 22:05:38
手握几十亿“政府支票”,却无法变成钱,安徽老板被法院通知破产

手握几十亿“政府支票”,却无法变成钱,安徽老板被法院通知破产

杰丝聊古今
2026-09-13 01:16:47
2-2!AC米兰遭加图索狙击+2连平 5000万新援登场2分钟连追2球救主

2-2!AC米兰遭加图索狙击+2连平 5000万新援登场2分钟连追2球救主

我爱英超
2026-09-13 07:08:22
一华裔男子现状曝光!曾就读于大连海洋学院,如今在纽约以乞讨为生,一天能赚60元

一华裔男子现状曝光!曾就读于大连海洋学院,如今在纽约以乞讨为生,一天能赚60元

小徐讲八卦
2026-09-13 09:00:07
一针没打的280万人,2026年身体真相曝光

一针没打的280万人,2026年身体真相曝光

华庭讲美食
2026-08-26 01:21:08
老板娘问我她屁股翘不翘?我该怎么回答?

老板娘问我她屁股翘不翘?我该怎么回答?

太急张三疯
2026-09-13 10:25:24
“穿成这样合适吗?” 幼师领舞被女家长围攻:女生都懂是怎么回事

“穿成这样合适吗?” 幼师领舞被女家长围攻:女生都懂是怎么回事

熙熙说教
2026-09-10 13:21:21
台湾退役中将帅化民表示,张学良被关一生不能算冤,因为西安事变那一夜,他差点让蒋介石从奉化带来的嫡系护卫全军覆没

台湾退役中将帅化民表示,张学良被关一生不能算冤,因为西安事变那一夜,他差点让蒋介石从奉化带来的嫡系护卫全军覆没

谈史论今1
2026-09-06 20:22:18
2026-09-13 11:39:00
智猩猩
智猩猩
AI 技术内容与服务平台
105文章数 5关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

白岩松追忆敬一丹:她走的从容而坚定 没有任何遗憾

头条要闻

白岩松追忆敬一丹:她走的从容而坚定 没有任何遗憾

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

主持人敬一丹去世,女儿悲痛发讣告

财经要闻

“1+N+X”!私募业,监管规则密集落地!

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

教育
亲子
旅游
家居
公开课

教育要闻

难哭中等生:1辈子想不到这辅助线

亲子要闻

火宝papa和小伙伴的教师节礼物!

旅游要闻

视频丨深度体验带动消费升级 这个暑期旅游还有哪些新趋势?

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版