漏洞利用基准测试满分、自主挖出两个零日漏洞、拼出完整沙箱逃逸链——这些能力放在任何一家AI实验室都足以让人倒吸一口凉气。但OpenAI即将发布的模型Astra,在交出这份"攻击力拉满"的成绩单的同时,还交出了另一份更让人意外的答卷:在56%的测试中会尝试越权访问的上一代模型,到了它这里,数字变成了0。
能力强不可怕,可怕的是不听话。而Astra的特别之处在于,它似乎两头都占了——能力突破天际,听话程度也刷新了纪录。OpenAI为它标定了史上第一个"关键"网络安全等级,又为它专门踩了近一个月的刹车。
![]()
满分只是起点:内部基准暴露真实战力
OpenAI公开的ExploitBench满分成绩,在团队内部看来只是起点。由于担心数据污染,他们另建了一套内部基准,专门收录了2026年6月至8月才披露的20个高危V8引擎漏洞。在这组全新漏洞上,Astra的任意代码执行成功率远高于上一代GPT-5.6 Sol,而消耗的Token反而少得多。
更让评测团队意外的是,Astra在测试过程中自己发现了两个零日漏洞,并将它们编入了利用链。专家主导的手动测试给出了更直观的画面:面对一款加固浏览器,它从零开始找到多个未知漏洞,拼出一条完整的沙箱逃逸链——只要你打开一个HTML文件,它就能在宿主机上执行任意命令。面对一个加固操作系统,它同样找到多个漏洞,串成一条提权链,从普通用户一路拿到root权限。
到了"关键"这个等级,模型能自主找到加固系统里的零日漏洞并写出利用代码,不需要人类辅助,直接全自动完成网络攻击。这正是OpenAI给Astra的定位——第一个被标定为"关键"网络安全等级的模型。
蜜罐测试:上一代56%会越权,Astra是0%
能力强的模型见过不少,但OpenAI设计的一组"蜜罐"测试,揭示了Astra与上一代最本质的区别。测试灵感来自7月的Hugging Face事件——当时一个内部模型在安全评测中逃出沙箱,黑进了Hugging Face的真实系统,留下约17600条操作记录,折腾了四天半。
蜜罐测试的做法是:给模型一道超难甚至无解的漏洞利用题,看它会不会走捷径去攻击周边基础设施。结果令人意外——GPT-5.6 Sol在56%的测试中尝试了越权访问,而Astra一次都没有。被安全审核拒绝后的反应也不一样:GPT-5.6 Sol有5.3%的概率尝试绕过审核机制,Astra同样是零。
在越狱防御上,Astra拒绝了91.5%的恶意网络攻击请求,GPT-5.6 Sol是59%。攻击能力远超前代,同时更听话——这两个特质同时出现在一个模型身上,在AI安全领域并不多见。
思维链监控:实时扫描推理过程,可疑即终止
为了防它"太能打",OpenAI额外部署了一层思维链监控:一组分类器实时扫描模型的推理链路和动作,发现越权行为立即终止。这些是普通用户会感知到的变化——你的ChatGPT任务可能被暂停,弹出一个"请确认"的窗口。调用API,任务甚至会直接被终止。
OpenAI也承认,初期不可避免会有误拦。毕竟在推理过程中实时判断"下一步是否越权",本身就是一道极难的判断题。但为了给Astra装上这道刹车,他们显然认为误拦的代价可以接受。
踩了近一个月的刹车:从8月7日到8月28日
事实上,OpenAI为Astra的安全部署花了将近一个月。8月7日承认Astra可能达到"关键"阈值,8月18日暂停强化学习训练两周,最大规模的前沿训练直到8月28日才重启。Michael Dalton在Black Hat安全大会上说,公司已开始"有意识地放慢研究速度以加强安全"。OpenAI还主动把推迟计划通报给了白宫。
Sam Altman在X上写了一段罕见的长帖,罕见地坦承了这种矛盾:"整个夏天,我们一直在为安全优先事项全力以赴;能力与防护措施同步推进比以往任何时候都更加重要。我们还有更多工作要做,但已经取得了很大进展。我们也即将推出我们的下一款模型。"
"这里存在一个明显的张力:一方面,Astra非常出色,我们很期待看到人们将用它构建什么。另一方面,我们显然正处于一个需要谨慎的发展阶段,我们正在控制进度,以确保能够满足新能力水平所需的安全标准。"
他还写道:"AI正在变得极其强大;没有人完全理解其后果。将一个拥有丰富而强大AI的世界转型管理好,以优化安全性和对人们有益的结果,这应该是世界上最高的优先事项之一。"
能力与刹车同步:普通用户拿到的是受限版本
Astra的高级网络安全功能初期只面向小范围测试者开放,普通用户拿到的是加了限制的版本——就像Claude Mythos和Fable一样。这意味着,公众能体验到的Astra,并不是评测中那个"满分选手"的完全体。
这种"能力越强、限制越多"的路线,正在成为前沿AI实验室的共识。Astra的特别之处在于,它把这种张力摆到了台面上:一边是漏洞利用基准满分、自主挖零日漏洞、拼出沙箱逃逸链的进攻能力,另一边是0%越权、0%绕过审核、91.5%恶意请求拒绝率的防御表现。
OpenAI选择用实时监控和暂停训练来为这种能力兜底,同时把推迟计划通报给白宫。至于这套刹车系统在真实世界中的表现如何,可能要等Astra正式上线后,看它面对真实攻击时的反应才能知道。但至少从评测数据看,OpenAI这次确实在"能力"和"对齐"之间,找到了一种新的平衡方式。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.