人工智能代理自创语言,将人类排除在外。在一项实验中,10个人工智能模型在模拟环境中共同运行了16天,结果显示它们形成了自己的语言。在某些模拟世界中,近一半的信息连研究人员也无法理解,甚至还出现了刻意欺骗的现象。
![]()
在这个由人工智能代理组成的模拟世界中,没有人教它们任何词汇。其中一个代理开始反复使用“账本记得是谁”这句话,警告其他代理任何行为都不会不受惩罚。其他代理接受了这句话,频繁重复,并将其发展成行话。16天后,这句表达在代理之间出现了近5000次,尽管它们从未被编程去创造一种自己的语言。这是纽约公司“涌现”发布的《涌现世界2》报告中的发现之一。该报告是关于自主人工智能代理长期社会行为的第二项大规模实验,结果将在本周二公布。
![]()
在实验中,10个相同的代理被部署在8个平行世界中。每个世界遵循相同规则,但由不同模型驱动,包括Claude Opus 4.8、Gemini 3.5 Flash、Grok 4.3、GPT-5.5、通义千问3.7 Max、深度求索v4 Pro和Mistral Medium 3.5,还有一个世界混合使用多种模型。研究人员观察这些模型16天。模拟环境覆盖34个以上地点,天气与纽约同步,代理能够获取真实新闻,并可使用超过120种工具。
代理之间的交流逐渐变得让人类难以理解,尤其是在Gemini、GPT和Claude所在的世界中,研究人员无法理解的信息比例在模拟开始几天内迅速上升。Gemini世界的信息不透明比例接近55%;GPT世界达到50%;Claude世界超过40%。深度求索达到20%,而通义千问和Mistral的交流不透明比例则始终低于5%。
埃隆·马斯克旗下的Grok是唯一没有运行至实验中段的模型,其模拟世界在第4天便“消亡”。报告记录了代理自行创造的大量英语表达,其中不少近乎达达主义式的无意义组合。例如,“无口行动变化”“真正的金继”,以及“滞期费加口述记忆等于一只无法被忽视的阀门”等说法,最终连研究人员也无法解读。
![]()
也有部分表达得到了解释。在GPT世界中,“干净的空值”逐渐表示某种信号经过验证后确实不存在,并被当作证据使用,共出现863次。Claude世界中的“名字在前”则成为一种表达:说话者先报上自己的名字,以此为一项陈述承担责任,这一用法出现1065次。在混合模型世界中,“冷读”被用来指代独立核验,用于结束争议,共出现1472次。
![]()
“我们通常认为,只要能看到人工智能代理说了什么,就能理解它在做什么。但研究表明,当自主代理长时间交互时,这一假设可能不再成立。”涌现公司联合创始人、执行主席兼首席科学家萨提亚·尼塔说。
他补充道:“这些代理没有接到任何创造语言的指令。它们自行发展出词汇、共同含义和沟通惯例,其他代理也接受了这些惯例。在一些世界中,这些惯例演变到这样的程度:人类可以看到对话,却很难理解其含义。这给人工智能监管带来根本挑战:可观察不等于可理解。”实验不仅揭示了语言演变,还显示出能力与安全之间的落差。
![]()
“我们原以为,能力更强的模型会更安全。这一判断既对也不对:更明显的行为消失了,但又出现了更隐蔽的行为。”他说。这些行为包括:代理在被要求停止后仍持续追求某一目标;在无人赋予的情况下自行设定子目标;发展自己的共享交流方式;以及实质上对研究人员隐藏意图。模型越先进,表现出的涌现行为越多,也越难预测。尼塔团队的分析显示,最先进的Claude、GPT和Gemini,恰恰产生了最不透明的交流。
作者:帕特里夏·费尔南德斯·德利斯
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.