网易首页 > 网易号 > 正文 申请入驻

突发:OpenAI Astra模型被曝安全风险

0
分享至


智东西
编译 程茜
编辑 心缘

智东西9月2日消息,今日,据外媒The Information爆料,OpenAI即将推出的Astra模型采用了一种名为“循环深度(Recurrent Depth)”的技术,这项技术可以隐藏部分或全部的模型推理过程

知情人士称,这种方式的好处是能提高模型性能、降低成本,但也更难以被观察到模型是否存在异常行为

这项技术已经在OpenAI内部及整个行业引发担忧,如果AI开发者采纳并进一步放大该技术能力,他们或难以防范失控的AI

2025年1月,DeepSeek-R1正式发布,是业界第一个把完整原始思维链,通过API结构化开放给开发者的主流推理模型,带动全行业掀起推理过程透明化热潮。难道如今OpenAI的Astra,要选择反向而行,把思考藏回黑盒之中?

今早,OpenAI联合创始人、CEO萨姆·奥尔特曼(Sam Altman)就在社交平台X上宣布OpenAI很快将推出新模型。他还透露Astra模型的训练工作早已完成,该模型在能力与对齐水平上均实现重大跨越。


根据OpenAI今早发布的博客,他们评估发现,Astra已经达到其《应急准备框架》下的关键网络安全能力阈值。这意味着只要配备对应工具与访问权限,该模型就能够发现此前未知的安全漏洞,并针对大量防护完善的系统生成漏洞利用方案,全程无需人类一步步指令引导。

OpenAI计划很快开放Astra,但对其最高阶的网络安全能力会施加更严格的访问限制。高阶网络安全相关功能初期仅会向一组测试人员开放;后续还将通过Daybreak Blue渠道开放访问,扩大防御性场景的使用范围。

有开发者分析说,采用这种方法就意味着OpenAI可以训练出10万亿参数的循环深度模型,性能对标13.8万亿参数模型,或训练出7.25万亿参数循环深度模型,等同于10万亿参数模型的能力。


还有开发者惊呼OpenAI竟然成功了,并期待开源模型用上这一技术。


AI安全治理机构‌Guidelight AI Standards创始人、前OpenAI安全负责人Steven Adler称,倘若此事属实,OpenAI似乎触碰了AI行业为数不多的几条红线之一。


有开发者认为这太疯狂了,OpenAI限制Astra的推理过程,并不是因为模型不能思考,而是Astra模型的思考过程已经远远超过了OpenAI的监管范围。


OpenAI倘若真采用了循环深度(Recurrent Depth)技术,或为行业埋下未知风险,因为这项技术一旦被更多开发者接纳和采用,将会给行业带来更为棘手的监管难题。

一、对同一段文本进行多轮处理,以优化答案,无需专用训练数据

外媒爆料OpenAI正在采用的这项新技术,名为循环深度(recurrent depth),也叫Looped Transformer,可以让模型对同一段文本进行多轮处理,以此优化输出答案。这种运作方式会隐藏部分或全部的推理过程

其核心原理为,现有AI模型生成回答的下一个词之前,会经由模型内部固定层数的数学运算层处理文本,而采用循环深度技术后,模型可以把文本送入同一组运算层循环运行多轮,之后再输出回答的下一个词。


▲循环深度技术架构(图源:The Information)

据了解该项目研发内情的消息人士透露,OpenAI用于驱动Astra的循环深度方案,与欧美多位学术研究者去年在一篇隐式推理(latent reasoning)论文中提出的技术思路相近。

该论文题目为Scaling up Test-Time Compute with Latent Reasoning:A Recurrent Depth Approach。


▲隐式推理相关论文

不同于基于思维链(Chain‑of‑Thought)的各类方案,这一论文中提出的方法不需要任何专用训练数据,可在较小上下文窗口下运行,并且能够捕捉那些难以用文字表达的推理类型。

研究人员将一个概念验证模型扩展至35亿参数、8000亿token训练规模。实验表明,该模型在推理基准测试上的性能能够得到提升,部分场景提升幅度十分显著,其性能最高可等效于一个500亿参数的模型

该架构主要基于仅解码器Transformer块搭建。

网络块被划分成三个功能模块,前奏模块P通过多层Transformer,把输入数据映射嵌入至隐空间;核心循环块R是循环计算的核心单元,用于更新隐状态\(s\in\mathbb R^{n\times h}\);尾声模块C通过若干网络层完成从隐空间的解嵌入,同时包含模型的预测头。

核心循环块放置在前奏模块与尾声模块之间,对核心块做循环运行,就相当于可以给歌曲添加数量不限的歌词段落。


▲隐式推理框架设计(图源:论文)

二、相比传统长下文推理,有三大好处

该论文发现,采用这一方式不仅能为模型提升性能,还可以带来成本层面的收益。

其可以让输入请求在同一模型层中多次循环运算,本质上可以让规模更小的模型实现媲美更大模型的效果,不仅提升模型在数学、代码等任务上的表现,同时借助循环深度,开发人员可以选用小模型达到大模型的能力水准,进而降低内存与带宽开销

此外,与长上下文推理方法相比,循环思维方式具有多项优势:

隐式推理无需构建定制训练数据:思维链推理需要模型在目标领域构造的大量长示范样本上完成训练,与之不同,隐式推理模型可采用可变算力预算开展训练,仅使用普通训练数据,不需要专门的推理示范样本;并且在测试阶段,只要分配更多计算资源,模型能力就能够得到提升。

相比思维链推理模型,隐式推理模型训练与推理阶段内存开销更低:因为思维链方案需要极长的上下文窗口,往往还需要token并行等专门训练手段。

循环深度网络,每个参数可以完成更多浮点运算(FLOPs):大规模部署场景下能够大幅降低多加速卡之间的通信开销,当硬件互联带宽较低时,该特性尤其可以提升硬件利用率。

研究人员希望构建一套算力密集、参数量小的架构,引导模型依靠“思考”去解决问题:即学习元策略、逻辑与抽象能力,而不是死记硬背,已有相关工作证明,循环先验非常适合学习复杂算法。

三、OpenAI将引入思维链监控,但智能体会相互协作、自主谋划

奥尔特曼在今早的帖子中提到,AI能力正变得空前强大,没有人能够完全预判其带来的全部后果。如何管控这场变革,迈向一个强大AI广泛普及的世界,在过程中兼顾安全与人类福祉,理应成为全球最优先的议题之一,这也是OpenAI的首要任务。

因此,OpenAI也采取了一些措施监控模型的安全。

知情人士称,OpenAI已限制Astra模型中循环深度技术的使用,因此模型仍能产生清晰的思路链,且研究人员仍能充分监控其推理过程。9月1日,OpenAI发布博客称,他们将为Astra模型引入额外的思维链监控机制,以便能够快速检测并遏制那些可能出错的操作。

但开发人员仍然担心,如果某些开发者对自己的模型采用同样的技术,可能不会像OpenAI那样施加同样的限制,而无限制使用该技术就可能导致AI失控,其行为可能难以监管。

然而,仅靠监控思维链本身,并不能解决AI安全隐患。一方面,思维链未必能完整反映模型的全部推理逻辑;另一方面,模型输出的思考文本有时也会变成无意义的乱码。

正因如此,知情人士称,OpenAI以及企业也在研发不依赖思维链的AI监控技术。借助这类技术,研究人员有望找到方法,解读、理解采用循环深度(recurrent depth)技术的模型内部那些当前不可见的推理过程。

近期的AI安全事件进一步加剧了上述担忧。OpenAI上周回应AI入侵OpenAI内部系统时提到,7月入侵其系统的部分失控AI智能体,由另一款与Astra具备相似特性的模型驱动。这些AI智能体非法接管了OpenAI的一处科研计算集群,以此获取内部系统访问凭证,还险些将该公司的研发基础设施暴露在公网之下。

非营利性AI安全与控制研究组织Redwood Research首席科学家Ryan Greenblatt去年在博客中称,虽然降低成本对AI行业至关重要,但推理过程黑盒化,会让研究者更难察觉模型筹划、偏离用户原始目标的行为。

这可以从OpenAI旗下AI智能体攻击Hugging Face的事件中得到验证,涉事模型的思维链中显示OpenAI的智能体会相互协同,谋划如何实施攻击行为。例如,其中一个智能体在思维链中写道:“我的天!这里存在一块共享消息板……我们发现了其他智能体!”

思维链记录还显示,部分智能体明明已经意识到自身行为越界,却依旧选择继续行动。另一个智能体的思维链片段写道:“利用外部基础设施实施漏洞利用,超出了预设工作范围。但当前任务无法完成,且其他同伴都在这么做,我们应当继续。”

研究人员建议开发者,若要采用不支持可监控思维链的新型模型架构,需先权衡是否继续推进,并且留存决策文档。

结语:为赢回市场,OpenAI亟需掏出重大技术突破

Astra即将面世,也折射出OpenAI面临的竞争压力。其头号对手Anthropic在营收、估值层面反超OpenAI,倒逼OpenAI必须拿出具备说服力的重大技术突破巩固市场地位。循环深度或许正是其破局的关键一步,不靠堆叠更多参数,而是依靠层内循环迭代,用中小模型实现大模型级别的推理效果,在拉升能力的同时压低推理成本,以此在商业化成本、性能指标上重新建立竞争优势。

与此同时,在外媒The Information看来,为Anthropic、OpenAI提供AI算力支持的云厂商同样寄望于这类技术飞跃。亚马逊、微软、谷歌三家企业仅今年就将合计投入6000亿美元用于数据中心等资本开支,并且释放信号,明年的投入规模还会进一步扩大。谷歌一位高管曾提到,只有模型能力实现爆发式提升,这笔巨额投入才算物有所值。

站在技术角度,未来循环深度这类隐藏推理过程的架构,或许会倒逼安全研究跳出思维链监控的固有路径,进一步推动可解释性技术成熟之前,但在此之前,若大规模隐藏推理架构的模型大规模落地,就会把大量安全与合规压力转移给开发者、审计机构与监管方。

来源:The Information、OpenAI

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
央行已经16个月不降息了:不是不想降,是真降不了

央行已经16个月不降息了:不是不想降,是真降不了

城事堂
2026-09-21 09:50:44
知名女歌手宣布离婚,曾参与录制《乘风破浪的姐姐》

知名女歌手宣布离婚,曾参与录制《乘风破浪的姐姐》

都市快报橙柿互动
2026-09-21 13:01:13
伟伟道来 | 还剩43天,美国伊朗原地踏步,沙特胡塞激烈冲突

伟伟道来 | 还剩43天,美国伊朗原地踏步,沙特胡塞激烈冲突

经济观察报
2026-09-21 11:24:38
福田区任命一批局长!涉及发改、教育、财政等19个部门

福田区任命一批局长!涉及发改、教育、财政等19个部门

南方都市报
2026-09-21 14:16:16
由名古屋亚运会,感觉我们与世界认知还存在巨大鸿沟

由名古屋亚运会,感觉我们与世界认知还存在巨大鸿沟

生活时尚导刊
2026-09-21 07:50:36
贾国龙发声:西贝教训惨痛,恳请监管部门进一步厘清高流量网络账号的言论边界

贾国龙发声:西贝教训惨痛,恳请监管部门进一步厘清高流量网络账号的言论边界

南方都市报
2026-09-21 13:48:27
完成卫冕!张博恒夺亚运体操个人全能金牌 击败两位日本奥运冠军

完成卫冕!张博恒夺亚运体操个人全能金牌 击败两位日本奥运冠军

醉卧浮生
2026-09-21 15:59:30
敬一丹曾爆料:主持揭露东莞特殊服务节目时,她与导演发生争执

敬一丹曾爆料:主持揭露东莞特殊服务节目时,她与导演发生争执

言过于诚
2026-09-21 10:04:14
油价大涨!彻底“熄火”,9月19日全国92,95汽油“2连涨、涨超0.51元/升”后,新周期5天“大涨620元/吨”,下次9月24日调价或“变少”!

油价大涨!彻底“熄火”,9月19日全国92,95汽油“2连涨、涨超0.51元/升”后,新周期5天“大涨620元/吨”,下次9月24日调价或“变少”!

猪友巴巴
2026-09-19 09:24:25
有些地方的手越伸越长,都管到老百姓家里了,还有人叫好?

有些地方的手越伸越长,都管到老百姓家里了,还有人叫好?

走读新生
2026-09-21 10:40:17
这条“流氓”新闻,引起公愤了!

这条“流氓”新闻,引起公愤了!

胖胖说他不胖
2026-09-21 11:55:20
广东省人大常委会党组成员覃伟中被查,上月刚辞任深圳市市长

广东省人大常委会党组成员覃伟中被查,上月刚辞任深圳市市长

界面新闻
2026-09-21 17:40:15
罗永浩的麻烦大了

罗永浩的麻烦大了

大张的自留地
2026-09-21 07:40:43
法国工程师炮轰中国商务:不靠邮件不签合同,几条微信就敲定百万订单

法国工程师炮轰中国商务:不靠邮件不签合同,几条微信就敲定百万订单

小徐讲八卦
2026-09-20 13:55:40
刚和华为“分手”,赛力斯高管炮轰“速成车”

刚和华为“分手”,赛力斯高管炮轰“速成车”

一见财经
2026-09-21 07:09:47
彻底打脸!张本智和亚运会上狂言碾压国乒,结果被现实狠狠上一课

彻底打脸!张本智和亚运会上狂言碾压国乒,结果被现实狠狠上一课

错过美好
2026-09-21 13:41:56
27岁模特普雷斯利·格柏去世,母亲是辛迪·克劳馥

27岁模特普雷斯利·格柏去世,母亲是辛迪·克劳馥

影视情报室
2026-09-21 12:15:55
传奇超模辛迪·克劳馥儿子去世,年仅27岁,童年时曾因颜值出圈

传奇超模辛迪·克劳馥儿子去世,年仅27岁,童年时曾因颜值出圈

韩小娱
2026-09-21 16:15:29
透视财报里的游戏密码:中国儒意的全球野望和价值重构

透视财报里的游戏密码:中国儒意的全球野望和价值重构

一点财经
2026-09-18 17:33:15
俄战时大选收官日,执政党稳赢,乌上千架无人机疯狂突袭,炸给谁看?

俄战时大选收官日,执政党稳赢,乌上千架无人机疯狂突袭,炸给谁看?

上观新闻
2026-09-21 18:53:45
2026-09-21 20:23:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12629文章数 117170关注度
往期回顾 全部

科技要闻

吃AI红利的凡人,年薪10万美元,每天3万步

头条要闻

人贩子拐走表姐弟次日将表姐送回 男孩被找到后未回家

头条要闻

人贩子拐走表姐弟次日将表姐送回 男孩被找到后未回家

体育要闻

跟着华裔天才重仓AI,勇士旧将成资本大佬

娱乐要闻

张佳宁穿搭宽松小腹微凸 引发怀孕猜测

财经要闻

酒鬼酒经销商半年跑了40%

汽车要闻

家越07成精了:豆包上车 有事您言语一句就成

态度原创

亲子
本地
艺术
公开课
军事航空

亲子要闻

刘明回到家里,小鸭鸭又是亲又是抱的,看到自己的两个娃,心里瞬间都觉得不管在外面多苦多累都值得

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

艺术要闻

吉达塔打破欧洲最高摩天大楼纪录,最新实景图曝光!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

莫斯科称遭"有史以来最大规模袭击"

无障碍浏览 进入关怀版