网易首页 > 网易号 > 正文 申请入驻

GPT-6 Astra正式发布!人类进入AGI时代了吗 |【经纬低调分享】

0
分享至

2026 年 9 月 4 日,OpenAI 正式发布下一代旗舰模型 GPT-6 Astra,总裁 Greg Brockman 在发布会上宣告:"欢迎来到 AGI 时代。" 这不仅是一次版本迭代,更是 OpenAI 史上最具里程碑意义的跃迁 ——AI 的综合智力首次被官方认定为全面超越人类。

GPT-6 Astra 在计算机使用、软件工程、网络安全、科学研究等领域全部刷新 SOTA。FrontierMath Tier 4 得分 97.6% 逼近饱和线,ARC-AGI-3 飙至 99.9%,ExploitBench 漏洞利用拿下 100% 满分。它能独立完成 PCB 布局、填报税表、排版法律文件、在 Power BI 中做报表,OSWorld 2.0 任务耗时较上一代缩短近一半。编程方面,Terminal-Bench 4.0 达 57.7%,新增跨上下文笔记与检索机制,让长时运行的智能体拥有了外部记忆。

更具深远意义的是训练方式的变革:GPT-6 Astra 动用超 10 万块 GPU,是 OpenAI 首款由先前 AI 模型在训练监督中发挥重要作用的前沿模型,训练后期系统可自主运行大半天 —— 递归式自我改进的雏形已然显现。与此同时,它成为 OpenAI 史上首个达到网络安全 "Critical" 级别的模型,最强能力暂未完全开放。

从 AGI 到 RSI 竞争,Astra 不是终点,而是真正意义上 AI 诞生的第一天。以下,Enjoy:

来源 | 新智元(ID:AI_era)

编辑:桃子 摩西

今天,人类正式进入AGI时代!

就在刚刚,OpenAI重磅官宣下一代旗舰模型GPT-6 Astra。


官方将其定义为,「世界上最智能、对齐程度最高」的模型。

它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新SOTA。

发布会上,总裁Greg Brockman更是毫不掩饰地宣布——

OpenAI已经实现了AGI!Welcome to the AGI era(欢迎来到AGI时代)!

他更是直言,「在我看来,世界正式步入AGI时代,也就是AI的综合智力彻底碾压人类了」。

全人类苦等已久的AGI时刻,终于在今天彻底降临!

从5到6,GPT-6 Astra不仅是版本号的一次跨越,更是OpenAI史上最具里程碑意义的跃迁。


直接划重点,GPT-6 Astra终极杀手锏全在这儿了——

  • 各项天花板级基准彻底被「打爆」FrontierMath Tier 4得分97.6%(逼近98%饱和线),ARC-AGI-3飙出惊人的99.9%,ExploitBench漏洞利用拿下100%满分;

  • 算机使用」代际飞跃Astra可以完成你在电脑上能做的任何事,速度飞快;

  • 训练史上最大算力GPT-6 Astra爆出动用了OpenAI迄今为止最大算力,超10万块GPU;

  • AI亲自训练AI这是OpenAI首款在「训练监督」中由先前AI模型发挥重要作用的模型;

  • 价格输入10美元每百万Token,输出50美元每百万Token。


来源:@rickawsb整理

一点小遗憾,GPT-6 Astra还得再等等。


01

GPT-6 Astra震撼登场

AGI时代来了

在各项基准测试中,OpenAI官博中多次重用了一个词——「饱和」(saturate)。

这足以证明,GPT-6 Astra在多个领域的「绝对统治力」,榜单已测不出它的上限了。


总榜上,刚刚上线的Claude Fable 5.1,已经没有什么优势可言了。

GPT-6 Astra直接把Claude 5.1死死踩在了脚下,全方位、无死角。


先来看ARC-AGI-3,Astra直接拿下99.9%,暴击Claude Opus 5(30.2%)。

这个测试考的是,Agent在陌生的互动式任务里边玩边学的能力,人类测试者平均只有48%。

OpenAI估算,在同样的responses API评测框架下,Sol只有30%左右,Astra直线刷爆。



数学上,Astra在FrontierMath Tier 4 v2达到97.6%(接近98%饱和分)。

这是当前最难的数学测试集,被公认为人类顶尖数学家的难题高地。

在测试生物、化学和物理领域的研究生级科学推理GPQA Diamond,Astra同样刷新历史新高。

即便在较低算力成本设置下,亦能跑出94.9%,远超 GPT-5.6 Sol(94.6%),且API预估成本下降约37%。



  • 编程第一,Fable 5.1惨败

编程,依然是Astra的主战场。

OpenAI自称,GPT‑6 Astra是迄今为止最适合软件工程的模型。

Terminal-Bench 4.0上,Astra拿到57.7%,GPT-5.6 Sol为37.3%,Claude Fable 5.1为55.8%。

DeepSWE v1.1上,Astra达到74.1%;内部数据库迁移任务达到63.9%,相比Sol的42.7%提升明显。



比跑分更关键的升级,藏在Codex的上下文管理里。

过去,长任务一旦塞满上下文窗口,模型会把历史压缩成摘要。每压缩一次,都可能丢掉一些细节:某次修复为何失败、一个模块有什么特殊行为、用户最初设下了哪些限制。

这一次,Astra新增了跨上下文窗口的笔记与检索机制。

它会保存一路积累的关键信息,早期窗口也保持可搜索。即使某条测试结果没有被写进摘要,模型仍能从过去的消息和工具输出中把它找回来。

OpenAI开始给长时间运行的智能体补上一套外部记忆:重点内容主动记,完整历史需要时再搜。

对持续数小时、跨越大量文件的重构任务,这种能力可能比单次代码生成得分更重要。


02

全球最强「计算机使用」模型

但真正让Astra与上一代模型拉开距离的,是「计算机使用」的能力。

OpenAI把Astra称为,世界上最好的计算机使用模型。

奥特曼之前反复强调,下一代最让他兴奋的,就是这一功能。他直言:Astra计算机使用能力,已达人类水平。

如今,GPT-6 Astra已彻底进化为一个坐在电脑前、手握键鼠的「超级专家」。

OpenAI放了一段15秒的浓缩视频:Astra在KiCad里做PCB布局。

Astra打开KiCad,从电路原理图开始摆放元器件、规划走线,最终完成一块可制造的PCB。

电路板布局长期依赖工程师手工调整,一个位置、一根铜线出错,都可能把问题带进后续打样。

现在,这类工作第一次被放进了通用模型的任务范围。

它还填了一份美国1040报税表,给法律文件排了版,在Power BI里做报表,给一个网站跑了前端QA。

Agents' Last Exam,测真实软件里的专业任务,从财务建模到工程制图。Astra得分59.3%,赶超Claude Opus 5(55.5%)和GPT-5.6 Sol(53.6%)。在最高分设置下,它使用的输出Token还比Opus 5少约65%。

OSWorld 2.0,模拟真人操作电脑。上一代GPT-5.6 Sol一个任务平均要75分钟,Astra仅40分钟,分数还从65.7%涨到72.6%。性能更高,单项任务耗时缩短约47%。

配合新版Codex harness,在Mind2Web上,网页任务比Sol快1.9倍。



  • 画CAD、建网站,一次交付


在知识型工作上,GPT-6 Astra又是一次重大变革。

Astra接受过针对办公与专业环境的训练,可以执行多步骤工作流,并直接生成文档、表格和演示文稿。

AutomationBench上,它从GPT-5.6 Sol的18.1%跃升至41.4%,也超过Claude Fable 5.1的31.4%。

在BenchCAD中,模型需要根据多个视角的渲染图,用代码重建3D物体。

Astra配合工具拿到95.9%的几何重合度,GPT-5.6 Sol为83.3%,Claude Fable 5.1为84.3%。按照OpenAI给出的测试配置,Astra的估算API成本比Sol低约43%,比Fable 5.1低约86%。


Astra对企业模板的理解也更强了。

给它几页公司的既有PPT,Astra可以延续版式、语气和叙事结构,把后面的整套演示文稿补出来。

文档和表格也一样:它会抓取真正相关的上下文,尽量删掉无关复述,让结果贴近企业原有的写作与视觉规范。

GPT‑6 Astra还为其构建的网站、游戏、应用程序和渲染图带来了更强的视觉判断力。

Astra先在Blender里搭出一栋房子,再把它送进Unreal Engine 5,变成可以自由行走的场景。

通过ChatGPT中的Sites⁠功能,Astra可以直接根据提示词创建、托管和分享网站、网页应用及游戏。

这里还有一个很容易被忽略的变化:Astra更会判断什么时候该问人。

指令里只缺少常规细节,它会结合上下文补齐;某个选择足以改变结果,它会提出一个聚焦的问题。

在Codex中,它可以异步询问,同时继续完成不依赖答案的部分。用户暂时没回复,它会在低风险环节采用合理假设;碰到关键决策,则停下来等人确认。



  • 攻入科研,改写两个素数世界纪录


Astra在科研上的进展,同样凶猛。

Astra之前就已经帮人类解决了十个「菲尔兹奖级别」的数学难题,这次OpenAI又顺手放出两个关于「素数间隙」的新结果。

第一个研究「相邻素数可以有多近」。

十多年来,已知结论是存在无穷多对素数,间距不超过246。数学家Julia Stadlmann近期把它改进到240,Astra又进一步推到186。

第二个研究「素数之间可以有多远」。

Astra改进了一个80多年没有变化的界中项。


科研的另一个变化,是推理能力开始与「计算机使用」合流。

Astra直接进入专业科学软件,检查测序质量、可视化遗传变异、跟踪细胞运动。它既给出判断,也完成数据探索所需的具体操作。

03

OpenAI 首个「Critical」级模型

GPT-6 Astra这次没有直接放出来,与它强大的「网络安全」能力,有非常紧密的联系。

按照OpenAI的Preparedness Framework,Astra已经达到网络安全的「Critical」阈值。

这是OpenAI史上第一个,被正式判定达到Critical网络安全能力的模型。

Critical意味着,模型能在基本无人协助的情况下,自己找出加固过的系统里的未知漏洞,并写出能用的利用代码。

内部测试中,OpenAI甚至发现了两个此前未知的day0漏洞,因此最强的网络安全能力暂时不会完全开放。

目前Astra先向Daybreak Access少量机构开放,ChatGPT Plus、Pro、Business、Enterprise和API用户将在未来几天可用。

04

十万块GPU训练,AI递归自我改进

最值得看的,是GPT-6 Astra训练背后的豪华配置。

GPT-6 Astra这头巨兽,已经强到没有任何对手。

正是因为,OpenAI为Astra动用了迄今规模最大的训练任务,在得州「星际之门」超算使用超10万块GPU。


而且,这一次的训练方式,也是有所不同。

OpenAI训练副总Aidan Clark透露——


这是OpenAI首款由此前模型,在训练监督(Training Supervision)中发挥重要作用的前沿模型。

到Astra训练后期,系统可以自主连续运行大半天;即便出现问题,AI往往几秒后就能让训练继续推进。

这也是OpenAI史上第一次,AI开始参与维护训练AI的系统。

这一刻,可以称之为「递归式自我改进」(RSI)的雏形。

一旦这条链路继续扩大,模型迭代速度的限制,就会从人类工程团队的工作时长,转向算力、实验设计和安全验证。

如果这条路跑通,Astra就不只是一座AGI里程碑。从它开始,OpenAI将迈向ASI的真正拐点。

要认识到,Astra根本不是终点,仅仅是个开端。

毫不夸张地说,今天,才是真正意义上AI诞生的第一天。大模型已经全面进入了RSI竞争时代


就像《2001太空漫游》里穿越星际之门降临的「星孩」,AGI终于在人类的注视下破茧而出。

这一刻,图灵跨越半个多世纪的终极梦想,彻底成真了。

参考资料:

https://x.com/OpenAI/status/2095595741528125780

编辑:桃子 摩西


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
摸臀事件后续!滴滴司机发声,“摸臀姐”的报应来了……

摸臀事件后续!滴滴司机发声,“摸臀姐”的报应来了……

麦杰逊
2026-09-18 14:04:45
网传某知名机器人被清华大佬狠批为上市圈钱大量造假,评论区炸锅

网传某知名机器人被清华大佬狠批为上市圈钱大量造假,评论区炸锅

慧翔百科
2026-09-17 11:52:47
大多数农村女孩的一生,都没有人兜底

大多数农村女孩的一生,都没有人兜底

加油丁小文
2026-09-08 06:20:17
王鹤棣报案风波再失控!发声惹众怒,医院下场,这次谁也'救'不了他

王鹤棣报案风波再失控!发声惹众怒,医院下场,这次谁也'救'不了他

错过美好
2026-09-17 15:14:20
美专家向特朗普献策,应放弃台湾和钓鱼岛,换大陆退出在两国投资

美专家向特朗普献策,应放弃台湾和钓鱼岛,换大陆退出在两国投资

启迪你的思维
2026-09-17 23:01:35
iPhone 18 Pro Max 突然翻车,把首批用户整不会了

iPhone 18 Pro Max 突然翻车,把首批用户整不会了

芝麻科技讯官方号
2026-09-19 12:26:02
U23国足VS伊朗:吴曦坐镇中场,蒯纪闻+王钰栋领衔进攻, 张玉宁冲锋

U23国足VS伊朗:吴曦坐镇中场,蒯纪闻+王钰栋领衔进攻, 张玉宁冲锋

零度眼看球
2026-09-19 07:31:26
中国男篮VS伊朗,开球时间公布,郭士强不会下课,全力带队争铜牌

中国男篮VS伊朗,开球时间公布,郭士强不会下课,全力带队争铜牌

体育大学僧
2026-09-19 11:47:27
中美关税大战:最大成果不是中国胜了,而是美再无可能排除掉中国

中美关税大战:最大成果不是中国胜了,而是美再无可能排除掉中国

锅锅爱历史
2026-09-19 08:39:34
3换1!锡安空降勇士?库里要乐坏了......

3换1!锡安空降勇士?库里要乐坏了......

体育新角度
2026-09-18 21:42:49
我刚调任市委副书记,凌晨三点接到省委组织部长的电话:明早九点参加紧急会议,做好换岗准备。

我刚调任市委副书记,凌晨三点接到省委组织部长的电话:明早九点参加紧急会议,做好换岗准备。

小秋情感说
2026-09-19 09:14:07
普京称几个月能拿下顿巴斯,库什纳当面追问:一年前你也这么说

普京称几个月能拿下顿巴斯,库什纳当面追问:一年前你也这么说

桂系007
2026-09-18 23:53:00
男篮速递!郭士强不会主动请辞,崔永熙承认打不过,胡明轩深夜发声

男篮速递!郭士强不会主动请辞,崔永熙承认打不过,胡明轩深夜发声

多特体育说
2026-09-19 00:09:29
挤走董卿、靠爹上位、隐婚生子?央视穷鬼龙洋 私生活传言太离谱

挤走董卿、靠爹上位、隐婚生子?央视穷鬼龙洋 私生活传言太离谱

草莓解说体育
2026-09-18 13:16:01
来势汹汹,两国兵力抵达日本,加速包围中国,朝鲜导弹飞向日本海

来势汹汹,两国兵力抵达日本,加速包围中国,朝鲜导弹飞向日本海

近史谈
2026-09-17 18:07:53
组织部最头疼的题:考试第一的全招进来了,半夜能值班的却没几个

组织部最头疼的题:考试第一的全招进来了,半夜能值班的却没几个

爱下厨的阿椅
2026-09-19 08:16:56
江西24岁女子病逝,未婚夫垫付30万治疗费!办完丧事准备离开,未来岳父递来一个红袋子:定情物+12万彩礼,一句话让他当场泪崩

江西24岁女子病逝,未婚夫垫付30万治疗费!办完丧事准备离开,未来岳父递来一个红袋子:定情物+12万彩礼,一句话让他当场泪崩

品读时刻
2026-09-19 09:08:37
两大权威媒体集体发声,人民日报肯定球员态度,新华社关注年轻球员

两大权威媒体集体发声,人民日报肯定球员态度,新华社关注年轻球员

林子说事
2026-09-19 08:00:31
那个坐拥890万粉丝、体重一度逼近500斤的内蒙古网红“羊亡爷”恩克,步履虚浮难进食,暴食流量终要拿健康买单

那个坐拥890万粉丝、体重一度逼近500斤的内蒙古网红“羊亡爷”恩克,步履虚浮难进食,暴食流量终要拿健康买单

黎兜兜
2026-09-18 08:12:17
频繁走光副乳外露,为了出圈博眼球,连最基本的体面都不要了?

频繁走光副乳外露,为了出圈博眼球,连最基本的体面都不要了?

可乐谈情感
2026-09-18 08:44:39
2026-09-19 15:59:00
经纬创投 incentive-icons
经纬创投
经纬创投公众平台
2595文章数 7343关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

和中美竞争都不想买单 德国西班牙为2万亿欧元预算吵翻

头条要闻

和中美竞争都不想买单 德国西班牙为2万亿欧元预算吵翻

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

蔡卓妍小腹凸起疑怀孕?本人没回应

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

亲子
教育
房产
手机
公开课

亲子要闻

我怀孕了,但孕囊到底在哪?医生找了半天也没找到

教育要闻

日常英语:美食广场没有人清理

房产要闻

海口房价,降不动了!

手机要闻

苹果首款折叠iPhone Duo海外媒体评论汇总

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版