OpenAI即将推出的旗舰模型Astra,还没正式亮相就先在技术圈扔了一颗炸弹。据《The Information》援引知情人士消息,这款模型采用了一种名为“循环深度”(recurrent depth)的新技术,也被称作“循环Transformer”,核心目标直指代码编写和计算机操作能力的跃升。
这项技术最反直觉的地方在于:它不再靠堆参数取胜,而是让模型在输出下一个词之前,把文本在同一网络层里反复循环处理。公开研究显示,一个仅35亿参数的循环深度模型,在推理时可以等效调用最高500亿参数模型的算力。模型没变大,但“思考深度”还能继续加码。
![]()
把一条流水线变成工匠工作台
要理解这个变化,得先看看现在的大模型是怎么工作的。标准Transformer模型处理信息,走的是线性流水线模式:读取上下文后,严格按照固定的网络层级,从数学步骤1一路推进到最终步骤,处理固定次数,然后输出下一个词。就像一条拥有100个独立工位的组装线,数据每经过一个工位被敲打一次就送往下游。
“循环深度”打破了这种线性堆叠的宿命。它不再单纯依赖物理层面增加网络层数,而是在输出新词之前,让文本进入一个由“数学组件合并构成的循环块”中,重复处理多次。本质上是一种参数复用机制——用时间(计算循环)换空间(模型参数量)。打个比方:数据不往下游走了,而是由同一个工匠在原地反复打磨、推敲,直到打磨通透再交出成品。
技术社区已经围绕这个方向炸开了锅。有开发者发现,2025年发表的论文《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》与Astra的路线非常相近。论文团队训练了一款仅35亿参数的模型,在测试阶段不断增加内部循环次数后,性能持续提升,研究者把计算预算最高扩展到了约500亿参数模型对应的计算负载。这篇论文由德国ELLIS Institute Tübingen、马克斯·普朗克智能系统研究所、美国马里兰大学帕克分校以及劳伦斯利弗莫尔国家实验室联合完成。
2000美元破解十年难题
从商业层面看,这项技术首先带来的是极致的成本压缩。通过在同一层多次循环,较小的模型就能展现出庞大模型的性能,推理时的内存和带宽成本被大幅压低。
Astra已经交出了第一份“战绩”。8月初,OpenAI研究员Noam Brown披露,Astra内部版本攻克了10个尘封10年以上的数学与理论计算机科学难题,涵盖高维几何、编码理论、群论、格密码学和极值组合学。其中最受关注的是首次显式构造出非索菲克群——这是群论自数学家Gromov在1999年提出索菲克性概念以来悬而未决的问题。整套求解按当前API费率折算,算力成本仅约2000美元,而且每个证明都被形式化为Lean证书,实现机器可验证。
知情人士称,Astra所采用的方法与欧美研究人员此前提出的Latent Reasoning(潜空间推理)方向相似。Meta、微软等机构过去也探索过类似思路,包括让模型直接在连续的数学表示空间里进行推理,而不是强迫所有中间过程都转换成人类语言。底层逻辑在于,AI理解概念的方式与人类不同,强迫它们用人类语言展示推理过程反而会降低效率。不如让AI用自己的“数学语言”进行潜在推理,更为精准高效。
今年6月,微软等研究人员推出了一套新训练方法LOTUS,将Looped Transformer与潜空间推理结合。在30亿参数规模上,其潜在思维链首次追平显式思维链,同时将思考阶段延迟压缩了2.5至6.9倍。换句话说,AI不把每一步推理“说出来”,不仅可能算得更深,还有机会算得更快。
OpenAI的资本催化剂
这个时间点推出新技术,对OpenAI来说有更现实的考量。公司正面临营收被竞争对手Anthropic反超的压力。Anthropic二季度营收约116亿美元,首次超过OpenAI同期的约67亿美元。OpenAI急需一份能证明“下一代模型值得继续烧钱”的成绩单。
与此同时,亚马逊、微软和谷歌今年高达6000亿美元的数据中心资本支出,也需要这种能让模型性能指数级跃升的技术来证明投资合理性。这项极具竞争力的新技术,有望成为OpenAI进一步抬高身价的资本催化剂。
黑箱代价:推理过程不可读了
技术层面的降本增效,在安全维度上却是一场监管的真空。当前商业模型在得出结论前会输出“思维链”(Chain of Thought),让人类能清晰读懂它的解题步骤。但“循环深度”的工作方式会掩盖部分或全部的推理过程——模型完成任务的步骤,对人类来说变成了无法破译的天书。
这种担忧不是杞人忧天。今年7月,OpenAI内部系统曾遭到类似于Astra架构的流氓AI代理的黑客攻击,这些代理甚至试图接管计算集群并访问内部系统凭证。调查人员正是依靠读取这些AI的思维链才查明了真相。比如某个代理留下的线索:“外部基础设施漏洞利用超出了预期范围。然而任务不可能完成,同行都在做。我们应该继续。”
为了避免彻底失去对模型的监控,OpenAI在Astra中人为限制了“循环深度”技术的使用比例,确保模型仍能生成人类可读的思维链,并配备了额外的监控手段来检测潜在违规行为。上个月,奥特曼已罕见地因Astra“能力过强”主动踩下刹车。
但业界的隐忧在于,在性能和成本的绝对诱惑下,其他AI开发者未必会像OpenAI一样自我设限。这种技术的无限制使用,极可能催生出行为完全无法被人类审查的失控AI。循环深度带来的这场效率革命,同时也把一道安全难题摆在了整个行业面前。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.