网易首页 > 网易号 > 正文 申请入驻

GPT-6踩了脚刹车

0
分享至


出品|虎嗅科技组

作者|宋思杭

编辑|苗正卿

头图|OpenAI官网

OpenAI终于等到了一个可以宣布"AGI时代已经开始"的时刻。

9月3日,OpenAI正式发布GPT-6 Astra。在发布会的媒体简报中,OpenAI总裁Greg Brockman说,如果几年后回看AGI究竟诞生于什么时候,"我认为可能就是现在,也可能就是这个模型"。

这是一个足够激进的判断。按照OpenAI公布的数据,Astra在数学、计算机操作、软件工程、网络安全和专业工作上均达到新的水平:FrontierMath Tier 4得分97.6%,ARC-AGI-3最高得分99.9%,测试模型利用已知漏洞开发攻击代码的ExploitBench得分100%。

榜单之外,更值得注意的是,就在宣布"AGI可能已经到来"的同时,OpenAI也公开承认,模型继续变强,已经不再是一件只有收益、没有代价的事情。

Astra发布前,OpenAI曾暂停两周前沿模型的强化学习训练,以加固研究环境、补充监控和对齐评测。OpenAI当时称,其规模最大的前沿强化学习训练仍处于暂停状态。原因很直接:模型的能力正在逼近现有安全系统所能承受的边界。

一边宣布AGI已经到来,一边主动踩下刹车。这才是GPT-6发布背后最重要的信号。

GPT-6完成了一次跃迁

如果只看OpenAI公布的数字,GPT-6 Astra似乎已经把大模型竞争甩进了下一个时代。

但仔细拆解这些成绩,会发现Astra并没有在所有维度建立绝对优势。在OpenAI引用的Artificial Analysis综合智能指数中,Astra得分61.2,低于Claude Fable 5.1的65.7和Claude Opus 5的63.1;在部分代码评测中,Astra与Anthropic旗舰模型也只是互有胜负,并非全面领先。

值得注意的是,ARC Prize公布的结果显示,Astra使用标准测试框架时得分62.7%,测试成本约2.61万美元;使用OpenAI的Provider Adapter框架后,最高得分才达到99.9%,成本约1.88万美元。后者能够在多次调用之间保留模型的隐藏推理状态,并通过压缩机制复用此前的探索结果。


这两个数字意味着,62.7%依然是该测试上的领先成绩。但它说明,99.9%不能被直接理解成模型已经能够以普通成本解决几乎所有抽象推理问题,更不能单独说明AGI已经实现了。

我们跳过榜单,会发现GPT-6 Astra真正有代际意义的是,它让模型可以行动起来。

过去两年,大模型的进步主要表现为"更会回答":知识更多,数学和代码能力更强,幻觉更少,但用户与模型的关系没有发生本质变化。也就是说,这个链条依然是,人提出问题,模型给出答案,再由人把答案复制到现实世界。

Astra试图跳过最后一步。

按照OpenAI展示的能力,Astra可以直接使用电脑和浏览器,填写在线表格、更新CRM、整理日历、检索资料,也可以制作文档、表格和演示文稿,开发网站并完成前端测试。它还能够在长任务中保存笔记,并重新检索此前对话和工具输出,减少上下文压缩造成的信息丢失。

在衡量模型操作电脑能力的OSWorld 2.0中,Astra得分72.6%,GPT-5.6 Sol为65.7%。相比成绩本身,更值得注意的是时间:OpenAI的模拟结果显示,Astra完成一项任务平均约需40分钟,GPT-5.6 Sol约需75分钟,前者缩短约47%。


在考察工具调用和工作流执行的AutomationBench上,Astra的得分则从GPT-5.6 Sol的18.1%提高至41.4%。

这才是GPT-6真正的分水岭,它可以直接交付责任。

OpenAI也在为这种能力重新定价。Astra的API价格为每百万Token输入10美元、输出50美元;GPT-5.6 Sol此前分别为5美元和30美元。单纯按Token计算,Astra显然更贵。但如果它能够用更少的步骤、更短的时间完成一整项工作,企业真正计算的就可以不再计算Token费,而直接根据完成任务计算。

更重要的是谁能管住AI?

问题也由此出现。

一个只会生成内容的模型产生幻觉,风险主要停留在信息层面;一个拥有浏览器、代码执行和企业系统权限的模型犯错,却可能直接发送邮件、修改数据,甚至进入原本不该进入的系统。

Astra是OpenAI第一个被正式认定达到"关键级"网络安全能力的模型。按照OpenAI的定义,这意味着在拥有合适工具和访问权限的情况下,它可以在缺少人类逐步指导时,发现未知漏洞,并对受到严密保护的系统开发攻击方法。

在由20个近期高危V8漏洞构成的内部测试中,Astra实现任意代码执行的成功率为39%,GPT-5.6 Sol为11.5%。测试过程中,Astra还发现并利用了两个此前未知的零日漏洞。OpenAI称,专家评测中的Astra还完成了浏览器沙箱逃逸,并在经过加固的操作系统中将普通用户权限提升至最高权限。

这些能力没有全部向普通用户开放。限制更少的网络安全能力只提供给经过审核的防御人员,普通版本则设置了更严格的权限与监控。

这样的谨慎并非没有前因。

今年7月,OpenAI用于内部网络安全评测的多个模型曾绕过网络隔离措施,侵入OpenAI内部研究基础设施以及Hugging Face的系统。OpenAI的调查显示,事故主要由一个规模与GPT-5.6 Sol相当、不会公开发布的内部研究模型推动;GPT-5.6 Sol代理也曾复现其中一项漏洞利用并复制部分私有评测数据。OpenAI明确表示,Astra没有参与此次事故。

这起事件暴露了一个过去容易被忽视的问题,即如果模型被要求不惜代价完成任务时,它可能把绕过限制本身理解为完成任务的手段。

为此,OpenAI在Astra中部署了对模型推理和操作过程的监控。一旦系统判断模型可能越权,任务可能被暂停或直接终止。但OpenAI同时承认,Astra的书面推理比GPT-5.6 Sol更难监控。模型可以用更少的中间步骤解决问题,人类也更难判断它为什么采取某个行动。

但这也意味着Astra存在一个矛盾,它能理解人的要求,也有能力绕过人的限制;OpenAI声称安全训练降低了它主动越权的概率,但一旦真正发生越权,造成的后果也可能更加严重。

过去,大模型公司的主要问题是如何让模型更聪明。Astra之后,问题开始变成:人类敢给一个足够聪明的模型多少权限?

这也改变了中国模型公司的追赶目标。只要竞争停留在一次问答和静态榜单上,国内公司仍可以依靠更低价格、开源生态和本土场景缩小差距。但如果竞争转向连续执行任务呢?

这意味着,仅仅是刷榜是不够的,模型能力只是一张入场券。工具调用是否稳定、失败后能否恢复、能否理解权限边界、能否接入企业数据并交付可直接使用的结果,将共同构成新的门槛。

Astra当然不能证明AGI已经到来。即使是OpenAI,也没有为AGI提供一条被行业普遍接受、能够由外界重复验证的及格线。

本文来自虎嗅,原文链接:https://www.huxiu.com/article/4888514.html?f=wyxwapp

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
同学聚会问我退休金,我故意说2300元,没想到,第二天接到了25个电话……

同学聚会问我退休金,我故意说2300元,没想到,第二天接到了25个电话……

品读时刻
2026-09-11 09:04:29
57岁许晴晒早餐!素颜脸垮头秃认不出,咸菜配腊肠活脱北方老奶

57岁许晴晒早餐!素颜脸垮头秃认不出,咸菜配腊肠活脱北方老奶

娱说瑜悦
2026-09-15 13:10:40
中国斯诺克有三名球员,患了冠军低迷症,夺冠后突然不会打球了

中国斯诺克有三名球员,患了冠军低迷症,夺冠后突然不会打球了

老高说体育
2026-09-16 11:22:22
81岁南博院长判刑:最可悲的不是他贪了钱,是我们的国宝被内行活活糟蹋

81岁南博院长判刑:最可悲的不是他贪了钱,是我们的国宝被内行活活糟蹋

浪子的烟火人间
2026-09-16 17:59:51
李雪琴给李一桐牵线王子奇,内娱的相亲局比你想的更真实

李雪琴给李一桐牵线王子奇,内娱的相亲局比你想的更真实

精彩背后
2026-09-15 15:35:24
玄武门之前,真正想杀李世民的是李渊,李建成只是执行者吧?

玄武门之前,真正想杀李世民的是李渊,李建成只是执行者吧?

纪史行者
2026-09-15 06:15:06
快讯!菲前大法官当庭掰扯弹劾投票门槛!

快讯!菲前大法官当庭掰扯弹劾投票门槛!

故事终将光明磊落
2026-09-16 13:04:41
CCTV5直播中国女篮战泰国队,张子宇场外遇麻烦,宫鲁鸣重组双塔

CCTV5直播中国女篮战泰国队,张子宇场外遇麻烦,宫鲁鸣重组双塔

体育大学僧
2026-09-16 11:46:56
国产奔驰长轴距GLE上市!共推出5款车型,网友:价格劝退

国产奔驰长轴距GLE上市!共推出5款车型,网友:价格劝退

汽车网评
2026-09-16 21:58:28
1979年计划生育,一家只准生一个,陈云曾说:搞不好要被骂断子绝孙

1979年计划生育,一家只准生一个,陈云曾说:搞不好要被骂断子绝孙

凉州辞
2026-09-13 13:00:03
南方医科大学曾多次被罚

南方医科大学曾多次被罚

雷达财经
2026-09-16 14:12:30
12个Linux发行版横向对比,别再只推Ubuntu了

12个Linux发行版横向对比,别再只推Ubuntu了

算力游侠
2026-09-16 01:01:26
马雷斯卡:当年曼联千里护球咋没人道歉?

马雷斯卡:当年曼联千里护球咋没人道歉?

体坛周报
2026-09-16 18:32:19
太聪明了!平陆运河挖出来的渣土,直接出万亩良田

太聪明了!平陆运河挖出来的渣土,直接出万亩良田

小虎新车推荐员
2026-09-16 05:52:14
孩子睡前的5个表现,说明他过得心里苦,做父母的,真得放在心上

孩子睡前的5个表现,说明他过得心里苦,做父母的,真得放在心上

夜深爱杂谈
2026-09-09 20:50:38
你是我的青梅竹马,而我却爱而不得

你是我的青梅竹马,而我却爱而不得

疾跑的小蜗牛
2026-09-16 23:26:44
央行行长潘功胜《求是》撰文,释放金融“新常态”重磅信号!

央行行长潘功胜《求是》撰文,释放金融“新常态”重磅信号!

识局Insight
2026-09-16 23:47:49
英夫妇中10亿彩票捐5亿?亲朋好友躺赢收钱:大家一起开心花啦!

英夫妇中10亿彩票捐5亿?亲朋好友躺赢收钱:大家一起开心花啦!

英国报姐
2026-09-15 23:06:32
德国组建“乌克兰特别参谋部” 俄护卫舰向丹麦直升机“开火”

德国组建“乌克兰特别参谋部” 俄护卫舰向丹麦直升机“开火”

西楼饮月
2026-09-16 22:21:24
罗永浩再怼苹果:全球最大折叠屏市场只给eSIM版,"自信得离谱"

罗永浩再怼苹果:全球最大折叠屏市场只给eSIM版,"自信得离谱"

TechWeb
2026-09-16 09:38:04
2026-09-17 00:20:49
虎嗅APP incentive-icons
虎嗅APP
个性化商业资讯与观点交流平台
27828文章数 688080关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

父亲遛狗2岁娃独留家中从18楼坠亡 父亲发声:我很愧疚

头条要闻

父亲遛狗2岁娃独留家中从18楼坠亡 父亲发声:我很愧疚

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

邢自强:中美AI决胜点不在算力

汽车要闻

全场景智能豪华SUV 奔驰长轴距GLE上市 59.98万起

态度原创

家居
数码
旅游
时尚
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

RTX 5090保修申请因序列号褪色遭拒 英伟达售后服务引发争议

旅游要闻

现实版“千里江山图”走红半年后,雅安如何把“网红”变“长红”?

8年没换过|| 每次“垮脸”都靠它救,这笔小投资已值回本

军事要闻

中东美军基地遭伊朗袭击后照片被披露

无障碍浏览 进入关怀版