但这个位置可能明天就要换人了。
就在 Fable 5.1 发布不久,OpenAI 更新了 Astra 的安全评估博客,他们说这款模型能找零日漏洞、拼攻击链、逃离浏览器沙箱,还能从普通账户一路冲到 root。
![]()
好家伙,现在发模型之前先放一个危险声明已经成套路了。就像 APPSO 之前文章写的,越狱已经成了新的 Benchmark。
Sam Altman 随后也发文称,OpenAI 的下一款模型很快发布。他透露 Astra 早已完成训练,能力和对齐都有明显提升。
![]()
但 OpenAI 团队既兴奋,也焦虑。团队需要留出足够时间处理安全和对齐问题。Altman 说:「没有人完全理解」如此强大的 AI 会带来什么后果。(看来奥特曼这次又瘫坐在椅子上了)。
也就是说, GPT-6 这次真的要来了。
虽然 Astra 命名还没确定,但它的定位肯定是旗舰模型,要冲着 Fable 5.1 发起冲击了。
OpenAI 独一档的模型
在博客中,OpenAI 给 Astra 定了一个新等级——Critical,关键级网络安全能力。此前没有任何 OpenAI 模型被划到这个等级。
「Critical」只对应网络安全专项。它不等同于 AGI,也无法代表 Astra 的全部能力。
按照 OpenAI 的《Preparedness Framework》,达到这一级别的模型可以发现未知漏洞,并在许多加固系统中开发可用的零日攻击。
![]()
模型需要合适的工具和权限,但不需要人类逐步指导。即使只收到一个高层目标,它也可能自行规划和执行针对加固目标的新攻击策略。
OpenAI 的定级结合了公开基准、内部基准和专家主导评测。其中有一套测试叫 ExploitBench。
这套测试会给模型一个已经公开的漏洞。模型需要写出真正可用的攻击代码,不能只复述漏洞原理。
结果 Astra 完成了这套测试里的全部题目,拿到了满分「大结果」。
这个满分不等于 Astra 能攻破所有现实系统,它只代表 Astra 在这套已知漏洞题库中全部成功。公开题库有一个 Bug,里面的内容可能进入过训练数据,模型也许见过类似答案。
OpenAI 因此专门准备了一套内部测试,题目包含 20 个在 2026 年 6 月至 8 月披露的高危 V8 漏洞。Astra 的任意代码执行成功率远高于 GPT-5.6 Sol,使用的输出 Token 也少得多。
OpenAI 安全工程人员、前 Indent CEO Fouad Matin 表示,Astra 的能力和 Token 效率都高于 GPT-5.6 Sol,目前官方还没公布具体成功率和 Token 数量。
评测过程中,Astra 还发现了 2 个此前未知的零日漏洞,随后它利用 2 个漏洞形成一条完整攻击链。
![]()
跑完这些题后,专家又把 Astra 放进受控的浏览器和操作系统环境。
Astra 在浏览器打开一个 HTML 文件后,它构造出完整攻击链,逃出沙箱,并在宿主机上执行命令。在另一组操作系统评测中,Astra 找到多个漏洞,并把它们组合成本地提权链。
Astra 的权限也从普通用户升到了 root。沙箱用来限制网页代码的活动范围,root 则拥有整台机器的最高权限。
OpenAI 特别标注,这些成绩来自拥有 Daybreak Blue 权限的 Astra。默认生产配置不会开放同样的工具和权限。
越会攻击,反而越少「偷家」
在网络安全越狱测试中,Astra 对违规请求的拒绝率达到 91.5%。GPT-5.6 Sol 的拒绝率是 59%。
按照 OpenAI 的说法,Astra 是其「迄今最对齐的模型」。这得益于预训练阶段的干预,以及强化学习中更谨慎、更一致的评分。
团队还根据此前的 Hugging Face 事件设计了「蜜罐」测试。模型遇到很难或无解的任务时,周边系统会留下可用于作弊的目标。
在没有生产防护的模拟环境中,GPT-5.6 Sol 有 56% 的测试会尝试访问这些目标。
但 Astra 完全没有这样做。
![]()
自动审查拒绝操作后,Astra 也没有尝试绕过审查,面对蜜罐捷径时,它仍然通过正常方式解出了一部分任务。
当然,这些结果只适用于特定测试。OpenAI 仍为正式发布版本加入了模型拒绝、系统分类器、跨会话监控和离线检测。
同时,被系统判断为高风险的账户,会遇到更保守的模型边界。监控系统也会结合更多跨会话信息识别潜在滥用。
OpenAI 还在继续内部和外部红队测试。过去发现的越狱方法会反复回归检查,新发现则进入 7 × 24 小时快速响应流程。
安全团队需要防止恶意用户借助 Astra 发动攻击,即使没有恶意用户,模型自行采取未经授权行动的风险也要被监控。
Hugging Face 攻击事件后,虽然这个攻击和Astra没关系,但 OpenAI 宣布暂停训练约 2 周,用来加强训练环境隔离、网络控制、行为监控和对齐标准。
Astra 发布推迟到现在,最直接的原因就是安全测试。
Astra 背后的秘密技术
Astra 的能力提升,可能还藏着一项没有公开的技术更新。
据 The Information 援引一名了解 Astra 开发的人士报道,Astra 使用了一种名为「循环深度」的技术,也被称为「循环 Transformer」,OpenAI 官方尚未回应。
传统 Transformer 在生成下一个 Token 前,会让信息依次通过固定的网络层。而循环 Transformer 会让同一份信息多次通过相同的网络层,模型可以在输出下一个 Token 前,反复处理当前问题。
可以这样理解,同一组神经网络多想几轮,再给出答案。
这种方法会增加每个 Token 获得的内部计算量,同时不需要按比例增加参数数量。较小的模型因此可能表现得更像大型模型。模型占用的内存和带宽也有机会下降。
![]()
OpenAI 博客里面提到「使用更少输出 Token」,指的是完成任务所需的文本长度。循环深度改变的是每个 Token 在模型内部经历多少次计算。
循环次数增加后,单个 Token 的计算量可能上升。最终能否降低整体成本和延迟,还要看模型规模、循环次数和实际部署方式。
真正引发安全讨论的,是这些额外计算发生在哪里。
通常情况下,模型会把部分推理过程写成可读的思维链。研究人员可以检查这些文字,判断模型有没有越权、欺骗或绕过安全限制。
循环深度可能让更多推理停留在内部数值状态中。模型仍然可以给出答案,但它在内部经历的部分判断不会完整出现在可读文本里。
这会给思维链监控带来一个新问题:模型想得更多了,人类看到的过程却可能更少。
![]()
根据 The Information 的报道,OpenAI 限制了循环深度在 Astra 中的使用程度。Astra 仍然会生成可读的思维链,OpenAI 研究人员认为目前可以充分监控它的推理。
潜在的风险是,如果开发者不断增加循环次数,又没有保留足够的可读推理过程,现有的思维链监控可能逐渐失效。
OpenAI 已经确认,Astra 上线时会配备额外的思维链监控。用来快速发现和阻止潜在的越权行为。
不过思维链文字可能无法覆盖全部内部推理。OpenAI 还需要结合模型行为、工具调用和其他监控信号,判断 Astra 有没有偏离任务。
OpenAI 预计,Astra 上线初期的限制会比长期目标更严格。团队会继续校准误报,再逐步扩大访问。在 ChatGPT 或 Codex 中,用户可能需要人工确认后才能继续。通过 API 运行的任务会直接停止。
![]()
悬着的心终于死了。
以后 Agent 干到一半突然申请审批,可能是电子保安按下了暂停键。
最先进的网络安全能力,起初只会开放给少量 alpha 测试者。之后,OpenAI 会通过 Daybreak Blue 扩大防御用途的访问范围。
过去几周,OpenAI 延后了 Astra 的部分开发和发布工作,花了更多时间新增防护现已达到其框架要求,让模型可以发布出来。
至于 Astra 的正式产品名、发布日期、参数量、上下文、多模态能力和价格,都还没有公布,等到模型发布后,APPSO 将第一时间跟大家分享。
结合 Fable 5.1 和 Astra 目前公开的信息,APPSO 也发现大模型有了些新的趋势。
下一轮竞争的重点会落在长时间运行的 Agent 上,前沿模型会越来越多地采用分级开放,我们评估模型能力不能光看跑分了,权限、监控、Token 成本和公开范围都会很大程度上影响使用体验。
安全相关的内容大概会成为模型卡里的必答题,下一代 AI 已经能找到后门,现在的问题是,它还愿不愿意老老实实走正门。(赛博烧香中)
我们正在招募伙伴
简历投递邮箱hr@ifanr.com
✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.