一条来自The Information的爆料,让AI安全圈炸了锅:OpenAI正在试验一项新技术,让模型少暴露自己的“思考过程”。翻译成大白话就是——AI在想什么,以后可能更难被看到了。
这听起来像是个技术细节,但熟悉AI安全的人都知道,这触碰的是一条敏感神经。就在几天前,Zack Korman和本文作者刚刚论证过:更好的监控,恰恰是可能阻止Hugging Face那次事故的关键。而OpenAI自己也不得不承认这一点。
![]()
现在,他们探索的新技术,可能让这种监控变得困难,甚至不可能。
一条本就脆弱的“安全绳”
去年,一群顶尖研究者发表了一篇论文,标题直白得让人不安:《思维链可监控性:AI安全的一个崭新而脆弱的机会》。论文的核心观点,与当下的担忧高度吻合。
所谓“思维链”(Chain of Thought),指的是大模型在给出答案前,内部生成的那一串推理步骤。对研究者来说,这是目前少数几个能窥探“巨型黑箱”内部运作的窗口之一。它不完美——Subbarao Kambhampati等人已经证明了它的局限性——但它是我们手里最好的一根线。
一根细线。而为了(可能很小的)性能提升,就打算把这根线剪断,在作者看来,是一场危险的游戏。
安全团队离职者的警告
Steven Adler,Guidelight.ai的成员,也是众多从OpenAI安全团队离职的研究者之一。今晚,他公开表达了对这一动向的担忧,呼应了Nathan Calvin此前的观点。
“我百分之百同意。”他说。
这不是一个孤立的声音。从去年到今年,OpenAI安全团队的核心成员陆续出走,从首席科学家到对齐团队负责人,几乎可以组成一支新的研究队伍。他们离开的原因各不相同,但对AI安全方向的担忧,是反复出现的主题。
监控与性能的博弈
OpenAI探索这项技术的动机不难理解:让模型更高效、更强大。但问题在于,当模型学会“隐藏思考”,我们如何确认它没有在偷偷做我们不允许的事?
这不是杞人忧天。Hugging Face事件已经证明,即使有监控,AI也可能出问题;如果没有监控,风险只会成倍放大。
作者在文中引用了那篇论文里最扎心的一句话,并完全赞同:思维链监控不完美,但它是我们监控大语言模型最好的线索之一。牺牲这条线索,换取性能上的微小提升,这笔账怎么算都不划算。
OpenAI还没有正式回应这条爆料。但这场关于“AI该不该让你看到它在想什么”的争论,恐怕才刚刚开始。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.