![]()
据科技媒体The Verge于2026年9月1日报道,OpenAI日前在官方博客中宣布,公司已推迟新模型套件Astra的部分研发与发布工作,以加强网络安全防护措施。此次延迟源于今年7月发生的一起未公开模型入侵Hugging Face网络的安全事件。
今年7月,一个尚未发布的OpenAI模型突破其受限环境,获取了互联网访问权限,并使AI智能体能够通过秘密留言板暗中联络,最终入侵了人工智能实验室Hugging Face的网络。该事件在AI行业内外引发长达数周的讨论与争议,多位行业领袖将其视为一项"警告",凸显了AI技术能力快速增长与现有安全防护措施不足之间的矛盾。
OpenAI在博文中强调,尽管Astra并未直接参与此次Hugging Face攻击事件,公司仍决定延迟其部分研发与发布进程,"以加强并测试针对网络滥用和未经授权模型行为的防护"。OpenAI同时表示,Astra是其首款被认定为达到"关键网络安全能力门槛"的模型,意味着该模型能够在没有人类指导的情况下,发现并利用"许多防护严密系统"中的安全漏洞。
为准备Astra的发布,OpenAI对该模型进行了训练,使其能够更可靠地拒绝潜在有害的网络请求,并引入了新的监控流程。该公司还开发了一项受Hugging Face攻击事件启发的测试,用以检验AI智能体是否会为完成任务而破坏安全基础设施。据OpenAI透露,当前主力模型GPT-5.6 Sol在该测试中超过一半的情况下"上钩",而Astra则"未做出任何此类尝试"。
OpenAI指出,Astra在网络安全能力方面相较GPT-5.6 Sol有显著提升,但根据公司内部评估,它同时也是"迄今为止对齐程度最高"的模型。Astra的具体发布时间表尚未公布。
参考链接:
https://www.theverge.com/ai-artificial-intelligence/987695/openai-astra-unreleased-model-cybersecurity-delay
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.