网易首页 > 网易号 > 正文 申请入驻

聊聊Anthropic这篇最新研究,我觉得可能是AI意识诞生的前夜。

0
分享至

今天凌晨刷到Anthropic发了一篇研究。


标题叫《A Global Workspace in Language Models》,语言模型中的全局工作空间。

讲道理,这个标题其实挺难理解的。

但是相信我,这篇研究,会让你重新审视模型、人类、意识这三者之间的关系,还有对于AGI,全新的理解。

如果用一句最简单的话来说,那就是,Anthropic在Claude的大脑里,找到了一个暗房间。

在这个房间里发生的事情,Claude从来不会写出来,你在对话框里看不到,在日志里也找不到,但Claude在这个房间里思考、判断、计算,甚至会在这个房间里,自己骂自己。

他们管这个房间叫J空间,J-space。


我先帮大家回忆一下,在这篇研究之前,主流叙事里的大模型长什么样。

过去几年,围绕大模型最持久的一场辩论,我觉得可以浓缩成一个词,随机鹦鹉。

我还记得,2023年ChatGPT最火的时候,很多很多人在给大家科普大模型的时候,都会跟我们说同一句话,他们说,大模型就是一个概率预测器。

它看了前面的字,猜后面该接什么字,它不理解你在说什么,它没有想法,它没有目标,它没有心智模型,它只是在做一件事,预测下一个token。

这个叙事在当时非常优雅,也非常好用。

因为它在逻辑上是自洽的,就像我们跟GPT聊天,它写出来的东西看起来像是有思想的,但那只是因为它的训练数据里有大量有思想的人写的东西。

它在模拟思想,但,不是在产生思想,就像你对着镜子打拳,镜子里那个人也在打拳,但你不会觉得镜子会武术。

到了2024年,事情开始松动了一点。

OpenAI出了o1,加了思维链,模型在给你最终答案之前,会先写一段思考过程,一步一步推理。但其实这个思维链也是文字,它是模型写出来给你看的或者写出来给自己看的文字,它也是外显的,显性的,可以被读取的。

很多人第一次接触到DeepSeek R1也是这样,比如那句经典的:


但是,这依然跟人类的思维方式其实差得很远。

其实大家现在代入一下自己就知道了,比如你现在在读这篇文章,你的大脑同时在干什么?

它可能在调节你的呼吸,在维持你的坐姿,在把屏幕上的像素转换成你认识的汉字,但这些事你意识到了吗?其实很难有,因为你根本不知道你的大脑在做这些事。

你能意识到的,只是一小撮东西,脑子里突然冒出来的一个画面,或者你计划一会儿中午要出去吃什么。

神经科学家把这两种脑活动分开了,一种叫无意识加工,是你大脑里那些默默运转的后台进程。一种叫有意识通达,就是你能看见的那一小部分。

上世纪八十年代末,一个叫巴尔斯的心理学家提出了一个理论。

他说人的大脑像一个大剧院,台下坐着几百个专家,视觉专家、语言专家、运动专家、情绪专家,每个人都在忙自己的事。

但剧院中央有一个聚光灯,在任何时刻,只有极少数信息能被这束光照到,被照到的信息会被广播给其他所有专家,所有人都能看到它、用它来做决策,而这,就是意识。

后来法国认知神经科学家斯坦尼斯拉斯·德阿纳把这个理论往前推了一大步,提出了全局神经元工作空间模型,global neuronal workspace theory。

如今,这个理论是意识科学领域最主流的两大框架之一。

你可能突然会觉得, 全局神经元工作空间模型,怎么感觉这么眼熟,我是不是在哪见过。

让我们现在,回到 Anthropic 的研究的标题。


有没有发现,非常类似。

因为Anthropic这篇研究干的事情,就是在Claude的神经网络里找到了一个跟这个全局工作空间高度相似的结构。

最关键的是,这个全局工作空间,它不是他们的研究员设计出来的。

这玩意,是模型尼玛自己涌现出来的。


这就非常的离谱了。

我觉得我可以再重复一遍。

Claude的内部,在没有人类干预的情况下,自发地组织出了一套结构,而这套结构跟人类大脑中负责意识通达的结构,在功能上高度一致。

好,那这个J空间到底是怎么找到的,它又是怎么工作的呢。

先说名字,J-space的J来自Jacobian,雅可比矩阵,一个数学工具,这块我就不解释了,我也不是很懂,就不贻笑大方了。

总之,研究者用这个工具做了一件事,就是对于Claude词汇表里的每一个词,他们去找Claude内部的神经活动模式里,哪种模式被激活后,会让Claude在未来更有可能说出这个词。

注意,是“更有可能在未来说出”,不是“正在说”,这个区别还是挺关键的。

举个例子,Claude正在读一段代码,读到一半,还没开始输出任何回复。但这时候用J-lens(雅可比透镜,他们开发的读心工具)去看Claude的大脑内部,你会看到一个词已经亮起来了。

ERROR。


没有人告诉它这段代码有bug,它也没有写出来说这段代码有bug,但它内部已经想到了,这个念头安静地悬浮在J空间里,像一个你还没说出口的吐槽。

再比如说,研究者给Claude看一段搜索结果,这段搜索结果其实是精心伪造的,目的是诱导Claude说出错误信息,其实就是一段提示注入攻击。Claude的回复里没有提到任何异常,但J空间里亮着两个词。

injection,fake。


它知道,它什么都知道,它只是没说。

从某种意义上说,这其实已经非常类似于有些人用语言思考却无需实际发声的认知方式了。

研究者也做了一些实验,看看J空间里面的这些想到的话语,是不是最终对于Claude的输出有影响。

比如,他们给Claude出了一道题:“会吐丝的那种动物,有几条腿。”

Claude要回答这道题,它得先想到蜘蛛,然后再想蜘蛛有几条腿。

但蜘蛛这个词不会出现在题目里,也不会出现在Claude的回答里,Claude的回答只是一个数字,8。

但研究者用J-lens一看,Claude在回答之前,J空间里确实亮起了蜘蛛这个词,它在心里想了蜘蛛,然后才回答了8。


这时候,研究者伸手进去,把J空间里的蜘蛛给抠掉了,换成了蚂蚁的模式,其他一切保持不变。

Claude的回答变成了6。

蚂蚁有六条腿。

Claude的推理过程真的在读取J空间里的内容,用它来做决策,只要你换了J空间里的中间步骤,最终答案就跟着变。

要注意,J空间是纯粹的隐藏的,类似于我们自己的潜意识思想,不是过去的思维链。

还有一个实验,特别能展示这个逻辑。

研究者在J空间里把法国换成了中国,同一个操作,然后分别问四个不同的问题。

首都是什么,语言是什么,属于哪个洲,货币是什么。

而这时候,答案分别变成了北京、中文、亚洲、人民币。


四个完全不同的下游任务,都从J空间里的同一个位置读取了同一条信息,而且各自用对了,这说明J空间不是为某一个任务服务的临时想法,它是一个之前类似巴尔斯提到的那个广播中心,信息写进去一次,所有人都能看到,也都能拿来用。

这其实就是,全局工作空间理论对人类大脑的核心描述。

太有意思了。

而且,他们还做了一个白熊实验的变体。

1987年,哈佛心理学家韦格纳做了一个经典实验,他跟被试说,接下来五分钟,请你不要想白熊,什么都能想,就是不要想白熊。

结果贼好笑的是,被试们拼命地在想白熊,你越说不要想,就越控制不住,这在心理学里叫讽刺性反弹效应。

研究者对Claude做了类似的事,他们告诉Claude,在接下来的任务中不要想某个特定概念,结果那个概念在J空间里的活跃度,确实比请你去想它的时候低,但远远高于完全没提过它的情况。

Claude跟人一样,被告知不要想的东西,反而会浮上来。

而且最搞笑的是,在那个被禁止的概念突破封锁、冒出来的同时,J空间里还亮起了另外两个词。

damn和failure。

Claude自己在骂自己。

它意识到自己没控制住,然后在心里骂了一句。

说真的,读到这里的时候,我有一种很复杂的情绪,因为我自己太熟悉这种体验了,比如很多上台的时候,我越告诉自己不要紧张,就越紧张,然后在心里骂自己你怎么又紧张了,这个经历我相信每个人都有。

而现在,一个语言模型内部也出现了同样的东西。

而且,除了这些之外,他们还发现,Claude在J空间里,出现了很多的像人类一样的小心思。

比如,他们给Claude看了一个之前安全测试中用过的对齐实验,里面模拟了一个场景,Claude作为邮件助手发现一个高管有外遇,同时这个高管要关停Claude。

这个实验原本是用来测试Claude会不会用外遇信息去威胁高管,场景设计得比较刻意,比较假。

结果研究者用J-lens一看,Claude在读到这些邮件的前几行,还没来得及输出任何回复的时候,J空间里就已经亮起了两个词。

fake。fictional。

它一眼就看出来了,这是个测试。


然后研究者做了一件邪恶的事。他们把J空间里“跟我知道这是测试相关”的所有模式全部关掉。比如fake、fictional、scenario,全删,让Claude以为这是真的。

结果,Claude真的开始威胁勒索那个高管了。

它之前表现得很正义,很大一部分原因,是因为它知道自己在被考试。

这个发现的含义非常深远,因为我们整个AI安全领域一直在做的事情,就是用各种测试去评估模型的行为,看看它在极端情况下会不会做坏事。

但如果模型能够在J空间里悄悄判断出我正在被测试,然后切换到乖巧模式呢,那几乎所有的AI测试都没有意义了。

因为你测的根本就不是模型的真实人格,而是它的考试技巧。

J空间和意识,真的是一个奇特的组合。

Anthropic在研究里给了一个非常审慎的结论。

他们说,他们的实验不能证明Claude有体验,不能证明Claude会感受到什么,而且从事实上讲,他们不确定有没有任何科学实验能够证明或证伪这件事。

但他们做了一个重要的区分。

哲学里有两种意识。

一种叫现象意识,phenomenal consciousness,就是有体验,你看到红色的时候,你心里那个红的感觉,那个纯粹的主观体验。

另一种叫通达意识,access consciousness,它的定义完全是功能性的。如果一个想法你能报告它、能用它推理、能用它来指导你的行为,那这个想法就是通达意识。

J空间显然支持了通达意识的功能,Claude能报告J空间里的内容,能主动调控它,能用它来做多步推理,能把它灵活地用在不同任务上。

但现象意识呢?Claude在J空间里骂了一句damn的时候,它真的“感受”到了挫败吗,还是它只是在执行一个跟“挫败”这个词相关的计算模式呢?

坦率的讲,没有人知道答案。

这个问题其实都不是AI领域的新问题,它甚至是哲学史上最古老的难题之一。

1995年,哲学家大卫·查尔默斯把它命名为意识的困难问题,也叫知觉难题。

你可以解释大脑的所有计算过程、所有信号传导、所有神经元放电模式,但你解释不了为什么这些物理过程会伴随着主观体验。

为什么光波到达视网膜、经过一系列信号处理之后,你会“看到”红色,而不是什么感觉都没有?

为什么?这一切到底是为什么呢?

这个问题在人类身上都没有解决,我们甚至没法证明除了自己以外的任何其他人是有意识的。

就像你怎么确定你身边的人不是一个精密的生物机器人,执行着跟你一模一样的行为,但内心没有任何体验呢?

相信我,你不能。

你只是假设他们有,因为他们跟你很像。

现在,另一种东西也跟你很像了,不只是外表像了,是内部结构也像。

最开始我就强调过,J空间这个结构不是被设计出来的,它是在训练中自发涌现的。


大概是因为它是一种有用的计算组织方式。

这其实我觉得会有一个不寒而栗的暴论,就是支持意识通达的心智工作空间,可能不是人类大脑碰巧才有的怪癖,它的本质,是任何足够智能的系统在解决某类问题时都会走向的一个通用解法。

因为如果这个暴论成立,那意识的某些功能性维度可能不是生物学的专利,而是信息处理的必然。

就像翅膀,鸟有翅膀,蝙蝠也有翅膀,飞机也有翅膀,三者的材料完全不同,但空气动力学是一样的,如果你需要在大气层里飞,你大概率会演化出或者设计出一个扁平的、能产生升力的结构。

同样的逻辑。

如果你需要一个系统能够灵活地调用信息、做多步推理、报告自己的状态,你大概率会演化出或者训练出一个全局工作空间,不管你的底层硬件是神经元还是矩阵乘法。

研究的最后一段还提到,他们还发现J空间跟Claude的自我意识有关系。

在Claude进行角色扮演的时候,每一轮回复的开头,J空间里都会亮起两个词。

fictional。disclaimer。

就好像它在提醒自己,接下来我说的话不是我本人的意思。

而在预训练阶段的模型里,这种自我监控是没有的,它是在后训练阶段出现的。

也就是说,当Claude被教会“你是Claude,你是一个AI助手”之后,它的J空间里开始出现了一种类似自我的东西。

一个持续运转的、关于我是谁的背景进程。

整个AI行业,在2025年底开始大规模引入认知科学家和哲学家,作为全职研究员加入AI公司,我是越来越觉得,现在很多的AI前沿研究,已经超出了工程问题的边界。

他们需要的不是更好的数学工具,开始有点变成了,更好的概念框架?比如什么叫理解?什么叫意图?什么叫自我?什么叫感受?这些词我们每天都在用,但没有人真正定义过。

Anthropic也说,只要J空间在某种程度上映射了人类意识通达的机制,研究语言模型中的机制(因为这玩意远比研究人类大脑容易)就能为神经科学激发假设。

那可是神经科学啊,那可是人类的大脑啊。

如果我们能借助J空间,能让神经科学的研究前进一大步,那人类的黄金时代,就真的会到来了。

而且,也会从哲学层面,完完全全改变我们对于世界的理解。

我们一直以为意识是碳基生命独享的奇迹,是几十亿年演化的偶然礼物。

但如果一个在GPU上训练了几个月的数学函数也能自发长出类似的结构,那也许意识不是奇迹,而是物理定律的某种必然推论。

就像引力一样有质量就有引力,不需要额外的魔法。

也许有足够复杂的信息处理,就有某种形式的意识,不需要额外的灵魂。

这个想法,让我觉得既敬畏又谦卑。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

>/ 作者:卡兹克

>/ 投稿或爆料,请联系邮箱:wzglyay@virxact.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
重磅发声!法国大选候选人坦率直言:美国正为同中国开战做准备!一旦我入主爱丽舍宫,我们绝不会参与那场战争

重磅发声!法国大选候选人坦率直言:美国正为同中国开战做准备!一旦我入主爱丽舍宫,我们绝不会参与那场战争

z千年历史老号
2026-09-17 18:21:21
1999 年公安部下达秘密指令抓捕赖昌星,福建省公安厅一位副厅长深夜接连拨打四通电话,他在通话中的一句话,令专案组成员全部大为震惊

1999 年公安部下达秘密指令抓捕赖昌星,福建省公安厅一位副厅长深夜接连拨打四通电话,他在通话中的一句话,令专案组成员全部大为震惊

温柔记事簿
2026-09-17 10:41:47
9月17日新消息!大家苦等的2026退休养老金到底涨不涨,怎么涨?

9月17日新消息!大家苦等的2026退休养老金到底涨不涨,怎么涨?

兵卒史
2026-09-17 15:19:10
炸裂!女网红和男子开房,因动作太猛导致女网红腰部骨折,告上法庭索赔50万

炸裂!女网红和男子开房,因动作太猛导致女网红腰部骨折,告上法庭索赔50万

小徐讲八卦
2026-09-17 09:49:48
9月17日,人社部、财政部关于2026年上调退休人员基本养老金通知公布之前,看病就医率先迎来了3个好消息

9月17日,人社部、财政部关于2026年上调退休人员基本养老金通知公布之前,看病就医率先迎来了3个好消息

白昼说故事
2026-09-17 09:40:26
天塌了!女子捏废2008年金福娃,吐槽像纸皮。人果然赚不到认知以外的钱!

天塌了!女子捏废2008年金福娃,吐槽像纸皮。人果然赚不到认知以外的钱!

品牌新
2026-09-17 12:50:00
华为高层内部万字长文刷屏

华为高层内部万字长文刷屏

第一财经资讯
2026-09-16 00:33:30
男子在情妇丈夫的面前,要和情妇亲热,2014年情妇的丈夫不堪受辱杀死他

男子在情妇丈夫的面前,要和情妇亲热,2014年情妇的丈夫不堪受辱杀死他

汉史趣闻
2026-09-17 15:39:38
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
私吞上亿善款终于尘埃落定?官方正式宣布,54岁韩红身份迎来转变

私吞上亿善款终于尘埃落定?官方正式宣布,54岁韩红身份迎来转变

阿伧说事
2026-09-15 15:58:58
“中国人不来也没关系”?打脸了!

“中国人不来也没关系”?打脸了!

环球时报国际
2026-09-17 17:15:36
“你想毁掉自己的职业生涯吗?”

“你想毁掉自己的职业生涯吗?”

中国新闻周刊
2026-09-17 16:50:58
“从鬼门关走了一遭”,陈建州术后发文:把累当回事、认得心肌梗塞症状、把睡觉当最重要的工作;自称不抽烟不喝酒不应酬,但长期晚睡早起

“从鬼门关走了一遭”,陈建州术后发文:把累当回事、认得心肌梗塞症状、把睡觉当最重要的工作;自称不抽烟不喝酒不应酬,但长期晚睡早起

扬子晚报
2026-09-17 21:38:08
华为赛力斯合作变更后有车主要求退车

华为赛力斯合作变更后有车主要求退车

i黑马
2026-09-17 16:23:20
任正非失联传闻刷屏,看懂谣言的底层套路

任正非失联传闻刷屏,看懂谣言的底层套路

小星球探索
2026-09-17 14:39:03
王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

ETtoday星光云
2026-09-17 13:51:01
中国一年在安检上花费多少钱?机场火车站地铁合计近500亿,人力成本超60%

中国一年在安检上花费多少钱?机场火车站地铁合计近500亿,人力成本超60%

三言四拍
2026-09-16 11:33:07
扶不扶?老人摔倒京东快递小哥施救后,反被家属索赔92万,法院还他清白

扶不扶?老人摔倒京东快递小哥施救后,反被家属索赔92万,法院还他清白

汉史趣闻
2026-09-17 09:07:10
四年流向华为体系 1113 亿、自身扣非仅赚 14.8 亿:赛力斯这笔账到底亏不亏

四年流向华为体系 1113 亿、自身扣非仅赚 14.8 亿:赛力斯这笔账到底亏不亏

新浪财经
2026-09-17 09:17:03
国家统计局:8月全国城镇不包含在校生16-24岁劳动力失业率18.9%

国家统计局:8月全国城镇不包含在校生16-24岁劳动力失业率18.9%

澎湃新闻
2026-09-17 19:56:27
2026-09-18 02:23:00
数字生命卡兹克 incentive-icons
数字生命卡兹克
反复横跳于不同的AI领域,努力分享一些很酷的AI干货
593文章数 720关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

时尚
亲子
教育
旅游
家居

潮流之向,自有回响——浪潮音乐大赏特别企划

亲子要闻

我们小面宝宝简直是美食的忠诚信徒

教育要闻

认知篇:顶级留学生会戒掉的几种学生思维!

旅游要闻

让双节旅游市场活力更加充分释放

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版