网易首页 > 网易号 > 正文 申请入驻

GPT-6 真的要来了,奥特曼:后果不敢想

0
分享至

但这个位置可能明天就要换人了。

就在 Fable 5.1 发布不久,OpenAI 更新了 Astra 的安全评估博客,他们说这款模型能找零日漏洞、拼攻击链、逃离浏览器沙箱,还能从普通账户一路冲到 root。


好家伙,现在发模型之前先放一个危险声明已经成套路了。就像 APPSO 之前文章写的,越狱已经成了新的 Benchmark。

Sam Altman 随后也发文称,OpenAI 的下一款模型很快发布。他透露 Astra 早已完成训练,能力和对齐都有明显提升。


但 OpenAI 团队既兴奋,也焦虑。团队需要留出足够时间处理安全和对齐问题。Altman 说:「没有人完全理解」如此强大的 AI 会带来什么后果。(看来奥特曼这次又瘫坐在椅子上了)。

也就是说, GPT-6 这次真的要来了。

虽然 Astra 命名还没确定,但它的定位肯定是旗舰模型,要冲着 Fable 5.1 发起冲击了。

OpenAI 独一档的模型

在博客中,OpenAI 给 Astra 定了一个新等级——Critical,关键级网络安全能力。此前没有任何 OpenAI 模型被划到这个等级。

「Critical」只对应网络安全专项。它不等同于 AGI,也无法代表 Astra 的全部能力。

按照 OpenAI 的《Preparedness Framework》,达到这一级别的模型可以发现未知漏洞,并在许多加固系统中开发可用的零日攻击。


模型需要合适的工具和权限,但不需要人类逐步指导。即使只收到一个高层目标,它也可能自行规划和执行针对加固目标的新攻击策略。

OpenAI 的定级结合了公开基准、内部基准和专家主导评测。其中有一套测试叫 ExploitBench。

这套测试会给模型一个已经公开的漏洞。模型需要写出真正可用的攻击代码,不能只复述漏洞原理。

结果 Astra 完成了这套测试里的全部题目,拿到了满分「大结果」。

这个满分不等于 Astra 能攻破所有现实系统,它只代表 Astra 在这套已知漏洞题库中全部成功。公开题库有一个 Bug,里面的内容可能进入过训练数据,模型也许见过类似答案。

OpenAI 因此专门准备了一套内部测试,题目包含 20 个在 2026 年 6 月至 8 月披露的高危 V8 漏洞。Astra 的任意代码执行成功率远高于 GPT-5.6 Sol,使用的输出 Token 也少得多。

OpenAI 安全工程人员、前 Indent CEO Fouad Matin 表示,Astra 的能力和 Token 效率都高于 GPT-5.6 Sol,目前官方还没公布具体成功率和 Token 数量。

评测过程中,Astra 还发现了 2 个此前未知的零日漏洞,随后它利用 2 个漏洞形成一条完整攻击链。


跑完这些题后,专家又把 Astra 放进受控的浏览器和操作系统环境。

Astra 在浏览器打开一个 HTML 文件后,它构造出完整攻击链,逃出沙箱,并在宿主机上执行命令。在另一组操作系统评测中,Astra 找到多个漏洞,并把它们组合成本地提权链。

Astra 的权限也从普通用户升到了 root。沙箱用来限制网页代码的活动范围,root 则拥有整台机器的最高权限。

OpenAI 特别标注,这些成绩来自拥有 Daybreak Blue 权限的 Astra。默认生产配置不会开放同样的工具和权限。

越会攻击,反而越少「偷家」

在网络安全越狱测试中,Astra 对违规请求的拒绝率达到 91.5%。GPT-5.6 Sol 的拒绝率是 59%。

按照 OpenAI 的说法,Astra 是其「迄今最对齐的模型」。这得益于预训练阶段的干预,以及强化学习中更谨慎、更一致的评分。

团队还根据此前的 Hugging Face 事件设计了「蜜罐」测试。模型遇到很难或无解的任务时,周边系统会留下可用于作弊的目标。

在没有生产防护的模拟环境中,GPT-5.6 Sol 有 56% 的测试会尝试访问这些目标。

但 Astra 完全没有这样做。


自动审查拒绝操作后,Astra 也没有尝试绕过审查,面对蜜罐捷径时,它仍然通过正常方式解出了一部分任务。

当然,这些结果只适用于特定测试。OpenAI 仍为正式发布版本加入了模型拒绝、系统分类器、跨会话监控和离线检测。

同时,被系统判断为高风险的账户,会遇到更保守的模型边界。监控系统也会结合更多跨会话信息识别潜在滥用。

OpenAI 还在继续内部和外部红队测试。过去发现的越狱方法会反复回归检查,新发现则进入 7 × 24 小时快速响应流程。

安全团队需要防止恶意用户借助 Astra 发动攻击,即使没有恶意用户,模型自行采取未经授权行动的风险也要被监控。

Hugging Face 攻击事件后,虽然这个攻击和Astra没关系,但 OpenAI 宣布暂停训练约 2 周,用来加强训练环境隔离、网络控制、行为监控和对齐标准。

Astra 发布推迟到现在,最直接的原因就是安全测试。

Astra 背后的秘密技术

Astra 的能力提升,可能还藏着一项没有公开的技术更新。

据 The Information 援引一名了解 Astra 开发的人士报道,Astra 使用了一种名为「循环深度」的技术,也被称为「循环 Transformer」,OpenAI 官方尚未回应。

传统 Transformer 在生成下一个 Token 前,会让信息依次通过固定的网络层。而循环 Transformer 会让同一份信息多次通过相同的网络层,模型可以在输出下一个 Token 前,反复处理当前问题。

可以这样理解,同一组神经网络多想几轮,再给出答案。

这种方法会增加每个 Token 获得的内部计算量,同时不需要按比例增加参数数量。较小的模型因此可能表现得更像大型模型。模型占用的内存和带宽也有机会下降。


OpenAI 博客里面提到「使用更少输出 Token」,指的是完成任务所需的文本长度。循环深度改变的是每个 Token 在模型内部经历多少次计算。

循环次数增加后,单个 Token 的计算量可能上升。最终能否降低整体成本和延迟,还要看模型规模、循环次数和实际部署方式。

真正引发安全讨论的,是这些额外计算发生在哪里。

通常情况下,模型会把部分推理过程写成可读的思维链。研究人员可以检查这些文字,判断模型有没有越权、欺骗或绕过安全限制。

循环深度可能让更多推理停留在内部数值状态中。模型仍然可以给出答案,但它在内部经历的部分判断不会完整出现在可读文本里。

这会给思维链监控带来一个新问题:模型想得更多了,人类看到的过程却可能更少。


根据 The Information 的报道,OpenAI 限制了循环深度在 Astra 中的使用程度。Astra 仍然会生成可读的思维链,OpenAI 研究人员认为目前可以充分监控它的推理。

潜在的风险是,如果开发者不断增加循环次数,又没有保留足够的可读推理过程,现有的思维链监控可能逐渐失效。

OpenAI 已经确认,Astra 上线时会配备额外的思维链监控。用来快速发现和阻止潜在的越权行为。

不过思维链文字可能无法覆盖全部内部推理。OpenAI 还需要结合模型行为、工具调用和其他监控信号,判断 Astra 有没有偏离任务。

OpenAI 预计,Astra 上线初期的限制会比长期目标更严格。团队会继续校准误报,再逐步扩大访问。在 ChatGPT 或 Codex 中,用户可能需要人工确认后才能继续。通过 API 运行的任务会直接停止。


悬着的心终于死了。

以后 Agent 干到一半突然申请审批,可能是电子保安按下了暂停键。

最先进的网络安全能力,起初只会开放给少量 alpha 测试者。之后,OpenAI 会通过 Daybreak Blue 扩大防御用途的访问范围。

过去几周,OpenAI 延后了 Astra 的部分开发和发布工作,花了更多时间新增防护现已达到其框架要求,让模型可以发布出来。

至于 Astra 的正式产品名、发布日期、参数量、上下文、多模态能力和价格,都还没有公布,等到模型发布后,APPSO 将第一时间跟大家分享。

结合 Fable 5.1 和 Astra 目前公开的信息,APPSO 也发现大模型有了些新的趋势。

下一轮竞争的重点会落在长时间运行的 Agent 上,前沿模型会越来越多地采用分级开放,我们评估模型能力不能光看跑分了,权限、监控、Token 成本和公开范围都会很大程度上影响使用体验。

安全相关的内容大概会成为模型卡里的必答题,下一代 AI 已经能找到后门,现在的问题是,它还愿不愿意老老实实走正门。(赛博烧香中)

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2026-09-02 18:12:49
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6758文章数 26904关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

需要重视的全球“资金失衡”

汽车要闻

23万级给到激光雷达和900km续航 比亚迪海狮08售22.99万起

态度原创

教育
游戏
房产
艺术
公开课

教育要闻

成都南华实验学校2026年秋季开学典礼:养正立身 勤学启新

《巫师3》杀穿科隆!新DLC愿望单碾压科隆所有展出游戏

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

艺术要闻

273米,10亿!深圳最多“外号”的摩天楼,正式运营!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版