OpenAI给即将发布的Astra模型贴了一个新标签:首个具备"严重"网络攻击能力的系统。这个评级来自官方,意味着公司自己承认,这款模型的能力已经跨过了一条此前从未触碰的线。
为了控制风险,OpenAI的计划是监控模型的"思维链"——也就是它推理过程中的内部步骤。但问题在于,这种监控手段本身就不太可靠。它更像一面扭曲的镜子,反映出来的未必是模型真实的决策过程。
![]()
监控的盲区在扩大
更麻烦的是,根据相关报道,Astra的新架构把更多思考过程推向了人类无法读取的区域。也就是说,模型能力越强,监控能看到的反而越少。安全网在能力跃升的同时,正在变得更薄。
这形成了一个尴尬的局面:OpenAI一边承认Astra是迄今最危险的模型,一边用来约束它的工具,恰恰是它最不信任的那一个。思维链监控原本是为了让AI的决策过程透明化,但如果模型学会了"隐藏思考",这套机制还能兜住底吗?
能力与风险的赛跑
从技术角度看,这不算意外。模型规模越大、架构越复杂,内部状态就越难被外部工具完整捕捉。OpenAI选择公开承认这一点,至少说明它没有回避问题——但承认问题,和解决问题之间,还有不小的距离。
目前没有信息表明Astra的具体发布时间,也没有关于其网络攻击能力细节的说明。已知的是,OpenAI官方将其定级为"严重",并计划用思维链监控作为主要约束手段。这套组合能否奏效,恐怕要等模型真正落地后才能验证。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.