网易首页 > 网易号 > 正文 申请入驻

GPT-6发布,OpenAI说AGI时代来了

0
分享至

北京时间9月4日凌晨,OpenAI把GPT-6 Astra发出来了。距离Anthropic发Claude Fable 5.1,正好两天。

Sam Altman的推文里有一句话我觉得挺值得单独拎出来看的:「It took us some extra time to ensure that we could meet the safety and alignment standards required for this capability level, but we think you'll find it worth the wait.」


翻译一下就是,我们晚了,但值得。这半年OpenAI被Anthropic压着打,GPT-5.5、GPT-5.6发一个比一个,年化收入5月还被反超了。所以这次Astra出来,我第一反应倒不是吓哭,是OpenAI终于有一个能跟Anthropic放在同一张表上、而且大部分行赢的模型了

发布本身挺狼狈,博客先被人从官网挖出来又撤下,官方链接一度打不开,发布前几个小时ChatGPT、Claude、Grok还同时宕机了一波。Greg Brockman那句「Welcome to the AGI era」倒是很快传开了。

先说订阅用户最关心的:Plus、Pro、Business、Enterprise几天内都能用上,用量算在现有订阅额度里,细节在第五节。下面是官方发布页和X上的东西,官方页在这:

https://openai.com/index/gpt-6-astra/

一、AGI似乎真的来了?

OpenAI这次开头就甩了三个接近满分的数:

FrontierMath Tier 4(v2)97.6%。这是目前最难的数学评测集,Fable 5就已经是87.8%,Opus 5是73.2%,GPT-5.6 Sol是80.5%(Sol是OpenAI两个月前发的上一代旗舰,官方脚注说ChatGPT聊天里那个Sol跟API和Codex里的还不是同一个版本,表里用的是后者)。有意思的是官方表里Fable 5.1这行写的是78.0%,比Fable 5还低,官方没解释,我也不太确定是什么原因。

配着这个分数,OpenAI又放了两个素数间隙的新结果:孪生素数间隙的上界,十几年前被压到246,前不久Julia Stadlmann改进到240,Astra直接推到了186;另一个是大间隙问题里一个80多年没动过的项,被它改进了。证明和精简版的思维链都挂在发布页上,能自己去看。

ARC-AGI-3 99.9%。这个数对比一下就知道有多夸张:GPT-5.6 Sol只有7.8%,Opus 5是30.2%,Fable 5和5.1没有公开分数。不过脚注里写了,这个分数是用OpenAI自己的Responses API harness跑的(harness就是模型外面那层工具和流程),改了两个设置,他们说不是专门针对ARC-AGI-3调的。VentureBeat提了一嘴,前阵子NVIDIA用Opus 5套个自己的harness也把ARC-AGI-3公开集做到了100%,所以这个分数看看就好,harness的贡献可能比模型本身大。

ExploitBench 100%。把已知漏洞变成可用的攻击代码的评测,GPT-5.6 Sol是78.5%,Opus 5是70%。这个数字就是第六节那堆限制的来源。

二、真正重要的编程类任务,倒也没全赢

这是我最关心的一张表,直接放官方原图:


逐行看一下:

Terminal-Bench 4.0,Astra 57.9%,Fable 5.1 55.8%,Opus 5 52.3%,Sol 37.3%。赢了,但赢得不多,2个百分点。

DeepSWE v1.1,Astra 74.1%,Fable 5.1 67.4%。看起来差距挺大,但同一行里Gemini 3.8 Flash是73.8%,Opus 5是73.7%,Fable 5是69.9%。所以这行Astra只是比Fable 5.1多,比其他几个基本持平。

FrontierCode 1.1,Extended和Main两个子集,Astra分别是64.5%和53.3%,Fable 5是64.9%和53.5%,都比Astra高,Opus 5的Main也是53.4%。这行OpenAI自己表格里就没赢。

Artificial Analysis的Coding Agent Index,Astra 67.0,Fable 5 67.2,Opus 5 68.1。也没赢。

内部的数据库迁移任务,Astra 63.9%,Fable 5.1 57.8%,这个是OpenAI自己的题,参考意义一般。

所以官方说的「best model for software engineering to date」,按他们自己的表,我的理解是:终端类agent任务确实领先了,但纯写代码改代码的评测上,Claude这一家的几个模型跟它是咬着的,谁高谁低看你挑哪个benchmark。The New Stack那篇的副标题就直接写了「does not clearly lead the coding pack」。

OpenAI这次很聪明的一点是,每张图都改成了横轴API成本、纵轴分数的画法:


Terminal-Bench 4.0这张,Astra的星星在左上角,Fable 5.1的方块在右边。官方图注说,Astra拿到57.9%那个点的估算成本,比Fable 5.1拿55.8%那个点低63%,比Sol低9%。定价明明差不多,成本能差这么多,主要是Astra输出token少。这个我没法验证,等推送到账号了自己跑一遍看token消耗吧。

三、电脑操控太猛了

官方给Astra的定位是「world's best computer use model」,官推那条宣传片的文案是「Anything you can do on a computer, Astra can do for you. Fast.」,几个小时就1100万次观看:


这块的数据也确实是全表里最好看的一块:

OSWorld 2.0(离线子集),Astra 72.6%,Sol 65.7%,Opus 5 70.2%。分数之外还有个时间数据,Astra平均每个任务40分钟,Sol要75分钟,快了47%。Anthropic自己给Fable 5.1报过77.9%,但官方脚注说那个用的是不同版本的OSWorld和改过的评分方式,不能直接比。

Agents' Last Exam,在真实软件里做财务建模、工程、媒体制作这种专业任务,Astra 59.3%,Opus 5 55.5%,Sol 53.6%,Fable 5 48.7%。官方还补了一句,最高分设置下Astra的输出token比Opus 5少65%。

ScreenSpot-Pro(不带工具的屏幕元素定位),Astra 92.7%,Sol 76.9%,Fable 5是87.3%,脚注说这个数其实是Mythos跑的(就是安全措施更少的那版Fable)。

AutomationBench,Astra 41.4%,Fable 5.1 31.4%,Sol只有18.1%。

数字之外,发布页上挂了十几段演示视频,我把几段扒下来转成了GIF,都是官方原片压缩的,看个意思:


这是在KiCad里画PCB电路板,把原理图布成可以拿去生产的板子,官方说这是15秒的浓缩回放。电路板布线是电子工程师手工做的活,也是硬件设计流程里最常见的卡点之一。


Excel建模竞赛题,4倍速。这个我看的时候有点意外,它是真的在Excel界面里一格一格操作,不是生成个文件丢给你。


Power BI做仪表盘。


给OpenAI自己的官网做前端QA,边点边记bug到Linear里,这段是实时速度。


汽车变速箱的运动仿真,3D的那种。


Blender里建了个房子,导进Unreal Engine 5做成能走进去的场景,这段原片20秒,我只截了前6秒,不然压不进公众号的10MB。


然后是一组生活任务:找儿科医生、租房、预约DMV、低碳零食、幼儿园分析,官方给这组配的说法是「faster than you can」,演示页上挂着人类基准时间和模型时间的对比。这组是给ChatGPT普通用户看的,跟前面那些工程演示不是一个受众。


这张是官方放的Sol和Astra做个人求职网站的对比,左边Sol右边Astra。


还有一个能直接玩的卡丁车游戏(Pietro Schirano做的,用ChatGPT的Sites功能托管),我点进去开了一局,键盘WASD开车,空格漂移,完整的3圈8人赛。

看这些演示的时候我心情挺复杂的。我们最近一直在做和优化huashu-mac这个skill,让agent去操控那些没有API的Mac原生app,截窗口、点按钮、探测哪个app能自动化,前后折腾了好几轮。现在看,模型的更新把这事碾压过去了。之前很多人跟AI配合的方式还是AI负责智力劳动,我帮AI干苦活,去不同的软件里测试、截图、把浏览器的报错复制粘贴回去。现在特么的,看起来这部分苦力活也没必要了。也许真正重要的是该给GPT-6配台Mac了,前段时间不是传OpenAI在疯狂采购Mac mini吗,8月底的报道说是几万台Mac mini和Mac Studio,专门用来训练电脑操作的agent,Anthropic走的是在AWS上租Mac mini的路子。现在回头看,那批机器就是为这个准备的。

Dan Shipper(Every的CEO,他们家每次新模型都出vibe check)说电脑操作这块他用的词是「wild」,它能连续几小时在复杂的app里干活,Every那期Fable 5.1的评测视频,初剪就是Astra做的。

四、科学和其他

Terminal-Bench Science 0.1,用终端和代码完成科研工作流(分析数据、跑模拟、拟合模型),Astra 64.6%,Fable 5.1 52.6%,Sol只有22.4%。成本曲线也是同一个画法:


GPQA Diamond 96.0%,Sol 94.6%,Gemini 3.8 Flash 95.3%,Fable 5.1 93.7%,这个评测基本饱和了,大家都在95上下。

BenchCAD(看多视角渲染图反推CAD代码),Astra 95.9%,Sol 83.3%,Fable 5.1 84.3%(脚注说Claude的分用的是Anthropic自己改过的评测设置)。

长上下文,MRCR v2 8-needle,512K到1M区间Astra 96.3%,Sol 73.8%,这个提升挺大的。

输的地方也列一下:Humanity's Last Exam(带工具),Astra 57.2%,Fable 5.1 65.0%,Fable 5 63.8%,Opus 5 63.6%,全输。Artificial Analysis的Intelligence Index,Astra 61.2,Fable 5.1 65.7,Opus 5 63.1,也输。这两行都在官方表里,OpenAI没藏。另外生命科学那三项(LifeSciBench、GeneBench Pro、MedChemBench)表里根本没有Claude,脚注说是因为Fable 5和5.1拒答了大部分题目。


五、订阅用户能拿到什么

ChatGPT:先给一小批组织,几天内推给所有Plus、Pro、Business、Enterprise用户,用量算在现有订阅额度里,不够可以另买credits。Pro、Business、Enterprise还能用GPT-6 Astra Pro。企业版默认是关的,要管理员手动开。

API:模型名gpt-6-astra,同时上了Amazon Bedrock。定价每百万token输入10美元、输出50美元,跟Claude Fable 5.1一模一样;GPT-5.6 Sol是5美元和30美元,所以输入贵一倍,输出贵六成多。Fast mode速度2.5倍、价格2倍。

Codex:这次有个我很想试的功能。以前上下文窗口满了靠compaction(把前面的对话压成一段摘要),压一次丢一点细节,比如某个修复为什么失败。Astra在Codex里可以跨上下文窗口记笔记,旧窗口的内容还能被搜索,不用反复压成一段摘要。现在是实验功能,要在config.toml里手动开,官方说几周内会变成Astra的默认行为。另外它在Codex里可以异步提问,问完不等你回答继续干不依赖答案的部分,你不回它就按合理假设走,涉及重大决定的才等你。

ChatGPT里的Sites:Astra可以直接从一句prompt创建、托管、分享网站和网页游戏,上面那个卡丁车就是这么来的。

六、网络安全这块被锁了一半

Astra是OpenAI第一个触发Preparedness Framework里Critical网络安全阈值的模型。官方页写得很直白:在没有生产环境防护的情况下,它能利用未知漏洞在加固过的浏览器里实现任意代码执行,能给加固过的操作系统写提权攻击代码。在那套V8漏洞评测里,它自己发现并用上了两个零日漏洞,OpenAI说已经在向维护者披露。

所以今天发布的这版Astra,会拒绝写漏洞利用的proof-of-concept(就是证明这个漏洞真能被打穿的那段代码),安全代码审查、打补丁这种可以做。API里如果触发安全检查,任务直接停,不是暂停等你确认。更松的权限走OpenAI Daybreak项目,先给一批经过审核的防御方,几周内逐步放开。

对齐这块有个数字我觉得挺有意思:OpenAI用之前Hugging Face那次事件(agent越权入侵的那次,8月OpenAI在Black Hat上自己披露的)做了个新评测,看模型碰到做不完的任务会不会越出授权范围,GPT-5.6 Sol不带防护时48%的情况会越界,Astra是0%。同时他们也承认,Astra的思维链比Sol更难监控,因为它在简单任务上写的推理步骤更少,这个他们说是「take the decline seriously」。

七、X上的第一波评价

Dan Shipper那条我觉得是目前最有信息量的,Every提前拿到模型测了一阵:


他的结论我概括一下:写作是他试过最好的模型,slop很少,好控制;电脑操作wild;3D游戏和可视化一句话能出很好的东西;但爱把事情做复杂,你要一个简单界面它给你堆一堆标签按钮,什么都想做成landing page。图里截不下的后面还有一句「Fable 5.1 still gets my biggest tasks」,大项目还是给Fable。


Theo(t3.gg)说他用了几周,「the smartest model ever released」「a taste of AGI」,底下Patrick Gerrits回他:你不是天天发Fable 5.1怎么提升你产出的吗,那时候怎么不用Astra。

The Rundown那条汇总推下面有个回复我看到的时候有点想笑:「love a chart where fable 5.1 exists purely to get dunked on in someone else's launch post」。顺便说一句,那条汇总推发得比官方还早一个多小时,里面ARC-AGI-3写的是98.6%,是禁令解除前的旧数,线上页现在是99.9%。

最后

AGI是不是真来了,或者什么是特么的AGI估计还要争论不停的。

但OpenAI切切实实的回来了,电脑操作和科研这两块是真领先,编程是咬着的,OpenAI似乎在不同的方向上找到了突破Anthropic和开源模型为啥的局面。

很可惜还暂时不能用,我手上OpenAI送的6个月Pro会员还在嗷嗷待哺呢!


等Astra推到我的账号,我会拿手上正在跑的几个项目实测一遍,特别是Codex那个跨窗口记笔记的功能,到时候再写。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一个卖超市的跑去盖楼,结果把整个建筑行业的脸打肿了。

一个卖超市的跑去盖楼,结果把整个建筑行业的脸打肿了。

流苏晚晴
2026-09-09 12:28:14
美成功拿下格陵兰岛,特朗普放话:中国永远无法上岛驻军

美成功拿下格陵兰岛,特朗普放话:中国永远无法上岛驻军

观史搜寻着
2026-09-21 18:22:47
贾国龙妻子张丽平,将直接持有的西贝股权全部质押给银行;郑州仅剩两家门店,西贝回应“两三个月内彻底倒闭”传闻称全国门店均正常运营

贾国龙妻子张丽平,将直接持有的西贝股权全部质押给银行;郑州仅剩两家门店,西贝回应“两三个月内彻底倒闭”传闻称全国门店均正常运营

大风新闻
2026-09-20 09:16:06
活力中国调研行 | 小猫出镜,织女出圈:一针一线绣出3000万

活力中国调研行 | 小猫出镜,织女出圈:一针一线绣出3000万

环球网资讯
2026-09-22 16:29:02
39军军长吴信泉对梁大牙直言:你不用嘚瑟,这顿饭是麦克阿瑟请的

39军军长吴信泉对梁大牙直言:你不用嘚瑟,这顿饭是麦克阿瑟请的

大运河时空
2026-09-22 17:15:05
乾隆皇帝一生临幸过多少女子?野史记载数字惊人,身体是真不错!

乾隆皇帝一生临幸过多少女子?野史记载数字惊人,身体是真不错!

文史达观
2026-07-27 14:28:24
大家管住手!管住手!千万要管住手!周三股市大概率要这样走了!

大家管住手!管住手!千万要管住手!周三股市大概率要这样走了!

趋势清风侠
2026-09-22 18:06:29
王力宏在健身房大秀8块腹肌,看呆网友!他都50岁了,为什么一点也不显老?

王力宏在健身房大秀8块腹肌,看呆网友!他都50岁了,为什么一点也不显老?

小方说跑步
2026-09-22 11:03:00
约定快递员上门取件,15岁女儿按母亲指示从5楼往下扔快递时不慎坠亡!父母起诉索赔,二审判了

约定快递员上门取件,15岁女儿按母亲指示从5楼往下扔快递时不慎坠亡!父母起诉索赔,二审判了

红星新闻
2026-09-22 13:42:33
川岛芳子被军统折磨了3年才枪毙,临终前直言:想和猴子葬在一起

川岛芳子被军统折磨了3年才枪毙,临终前直言:想和猴子葬在一起

风飘飘而吹衣
2024-11-10 17:11:11
蓝色小药片的“惊天反转”:明里让男人“雄起”,暗中将肿瘤“去势”?

蓝色小药片的“惊天反转”:明里让男人“雄起”,暗中将肿瘤“去势”?

一节生姜
2026-08-13 07:53:27
姆巴佩再抛争议言论:我是上赛季最佳球员 若拿不到金球奖我会失望

姆巴佩再抛争议言论:我是上赛季最佳球员 若拿不到金球奖我会失望

风过乡
2026-09-22 07:28:52
当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

坠入二次元的海洋
2026-09-11 00:35:48
痛心!38岁江苏美女教师梁娇去世,丈夫去世不到百天,女儿才7岁

痛心!38岁江苏美女教师梁娇去世,丈夫去世不到百天,女儿才7岁

云舟史策
2025-06-23 09:35:09
离谱双标!媒体嫌弃梅西告别战对手太弱,球迷一句话直接打脸

离谱双标!媒体嫌弃梅西告别战对手太弱,球迷一句话直接打脸

徐竦解说
2026-09-22 18:44:05
日经新闻披露,高市早苗原定9月21日启程访美,核心目标是在中方前抢先见特朗普一面,日本究竟在怕什么?

日经新闻披露,高市早苗原定9月21日启程访美,核心目标是在中方前抢先见特朗普一面,日本究竟在怕什么?

回京历史梦
2026-09-22 10:50:09
1986年陈永贵走完一生,全县无人前来吊唁,郭凤莲直言心声,凭一席话守住大寨人的铮铮骨气

1986年陈永贵走完一生,全县无人前来吊唁,郭凤莲直言心声,凭一席话守住大寨人的铮铮骨气

唠叨说历史
2026-09-18 17:40:18
名古屋亚运会没有任何一名中国运动员的欧美媒体关注度超过于子迪

名古屋亚运会没有任何一名中国运动员的欧美媒体关注度超过于子迪

叒女紫121
2026-09-22 11:31:33
打?奉陪到底,仙宾礁爆发激战,中方开始算账,第一个收拾波兰

打?奉陪到底,仙宾礁爆发激战,中方开始算账,第一个收拾波兰

知法而形
2026-09-22 01:49:26
太“下流”了!山东家长怒斥课外书《狼王梦》中描写母狼哺乳的文字,认为内容不适合小学生阅读,引发争议

太“下流”了!山东家长怒斥课外书《狼王梦》中描写母狼哺乳的文字,认为内容不适合小学生阅读,引发争议

火山詩话
2026-09-19 21:32:31
2026-09-23 02:56:49
AI进化论花生 incentive-icons
AI进化论花生
AI博主,AppStore付费榜第一的小猫补光灯app开发者
274文章数 129关注度
往期回顾 全部

科技要闻

OPPO Find X10:ColorOs 17比参数更值得聊

头条要闻

女子手臂被带刺"球"砸中扎20根刺 三家医院都处理不了

头条要闻

女子手臂被带刺"球"砸中扎20根刺 三家医院都处理不了

体育要闻

奖牌榜:中国单日再夺9金 合计32金13银8铜

娱乐要闻

曝王玉雯杨玏结婚又离婚

财经要闻

中国太空算力的来龙去脉 这篇文章讲透了

汽车要闻

东风日产新N7上市限时权益价10.99万起 实现33项升级

态度原创

健康
旅游
教育
公开课
军事航空

青春痘,究竟是怎么冒出来的?

旅游要闻

北京市属公园140余项活动迎双节

教育要闻

看过1000个创业者的人,在怎么教育自己的孩子?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普被指下令空袭胡塞武装后变卦 最后一刻叫停

无障碍浏览 进入关怀版