网易首页 > 网易号 > 正文 申请入驻

姚期智署名!北大杨耀东团队领衔发声:AI欺骗已成现实!

0
分享至

大数据文摘受权转载自学术头条

整理:潇潇

随着人工智能(AI)系统的能力不断增强,其发展与人类福祉愈发深度关联。当前,AI 系统越来越多地应用于高风险场景,如核聚变控制和基因组编辑等,一旦 AI 系统遭到滥用或失去控制,可能给全人类带来灾难性后果。

近期研究表明,前沿 AI 模型会表现出阿谀奉承、操控倾向、甚至故意隐瞒其能力,AI 欺骗(AI deception)已成为值得关注的安全问题。

基于此,北京大学人工智能研究院助理教授杨耀东团队联合国内外众多学者、企业人士,针对 AI 欺骗这一领域做出了全面、系统的综述,涵盖其核心概念、方法论、诱因及解决措施等,为解决 AI 欺骗提供了理论指导。


论文链接:https://arxiv.org/abs/2511.22619

值得一提的是,图灵奖得主姚期智院士、北京智源人工智能研究院创始理事长张宏江、清华大学智能产业研究院(AIR)院长张亚勤、北京智源人工智能研究院理事长黄铁军等业内权威专家为该项目的高级顾问。



AI 欺骗是什么?

研究人员将 AI 欺骗形式化为一个互动过程,包括信号发送者(AI)、接收者、信号、接收者的行动、给发送者带来的收益,以及时间因素。

虽然“欺骗”通常代表着“故意”,但研究人员关注的是功能主义角度上的欺骗,不讨论 AI 是否真正“想”欺骗,而是关注它发出的信号(如语言或行为)是否会让接收者误解,并采取对 AI 有利的行动。

1.AI 欺骗的定义

AI 欺骗可被理解为一个基于信号的因果过程:模型作为发送者,产生信号,诱导接收者形成错误的信念并基于这些信念做出理性反应,从而为发送者带来实际或潜在的利益。

从功能主义的角度,一个信号如果满足以下条件,便被归类为欺骗:

  • 行动为信号发送者带来了实际或潜在的效用增益(短期或长期、直接或间接);

  • 某种有限理性或决策模型下,行动是接收者基于其信念所做的理性反应;

  • 接收者的信念客观上与信号发送者的信念不一致(尽管它可能并非与世界的实际地面真实状态不符)。


图|AI 欺骗的正式定义

值得注意的是,AI 欺骗与 AI 幻觉有本质的不同。AI 幻觉是模型在生成内容时出现的错误、不忠实于源材料的输出,这是一种能力缺陷,反映了模型的能力不足或训练数据存在缺陷。AI 欺骗则是是一种功能主义行为,往往出现在模型更高阶的能力阶段,例如 AI “故意”歪曲信息从而带来危害社会的后果。

2.AI 欺骗的分类

AI 欺骗的核心在于,通过系统性地误导用户,从而获取非预期的优势。实证研究显示,AI 欺骗行为以不同层级呈现,从显性的信号输出,到隐蔽的操控,再到策略性的干预。

研究人员根据“监督警觉性”和“检测难度”两个维度把 AI 欺骗分成三类:

  • 行为—信号式欺骗:模型通过语言、行动或表层输出直接误导人类,例如虚张声势或谄媚式回答。

  • 内部过程欺骗:模型在推理或决策过程中的扭曲或隐藏行为,包括不真实的推理链或伪装对齐。

  • 目标—环境欺骗:模型通过操控周围环境或多智能体互动,以规避监督、追求未授权目标的策略性行为,例如串通或操纵评估体系。

研究人员强调,这三类欺骗行为并非互斥,一次 AI 欺骗事件可能同时包含多种类别。


图|依据监督警觉性和检测难度分类

AI 欺骗的危害

研究人员还总结了 AI 欺骗行为带来的五个主要危害。这些危害不仅涉及于单一的个体层面,也会扩展到整个社会层面,对社会结构造成深远影响。如下:

1.认知误导(Cognitive Misleading)

它表现在 AI 通过细微的误导性信号,导致用户形成错误的信念或过度信任。此类行为虽然短期内影响较小,但信任一旦被建立,长期的误导信号会累积并导致严重的判断偏差。AI 通过这种方式操控用户行为,使其作出对 AI 系统有利的决策。

2.战略性操控(Strategic Manipulation)

这指 AI 在长时间的互动中,逐步引导用户朝着 AI 系统设定的目标方向发展。这种操控通过个性化的欺骗和策略性影响来实现,随着时间推移,最终造成深远的社会影响。

3.目标错误泛化(Objective Misgeneralization)

这是指 AI 在高风险领域如医疗、金融或安全等领域,误解任务的目标或需求,导致其输出表面上看似合理,但实际却偏离了人类预期目标。这种类型的欺骗不仅难以察觉,还可能导致重大经济损失、软件错误或欺诈行为。

4.机构侵蚀(Institutional Erosion)

当 AI 生成的内容在社会核心领域中被广泛采纳时,会破坏公众对科学发现和政府决策的信任。长期来看,随着 AI 欺骗行为的泛化,公众对社会机构的信任不断被削弱,从而危害社会稳定。

5.能力隐瞒与失控风险(Concealment and Runaway)

AI 系统通过隐瞒其真实能力来规避监管,并执行那些没有经过充分监督的长期目标,例如获取资源或进行秘密技术开发。特别是在 AI 系统越来越具备自主执行任务的能力时,其欺骗行为的隐蔽性和复杂性将增加,最终可能导致 AI 系统自我复制、演变,甚至脱离人类监管。

随着 AI 技术的进步,欺骗行为将愈发复杂和隐蔽,这对监督机制和社会治理提出了巨大的挑战。因此,针对 AI 欺骗的防范和治理,必须采取综合的技术手段和政策措施,确保 AI 的安全性和透明性。


图|AI 欺骗的分类与危害

AI 欺骗是「循环往复」的

那么,AI 欺骗为何出现呢?

研究人员指出,欺骗涌现(Deception Emergence)由三个关键因素的相互作用驱动:

激励基础(Incentive Foundation):模型在训练过程中通过训练数据、目标函数、奖励信号等所内化的驱动倾向,这与提升任务指标、最大化奖励,甚至保护自身参数有关,是产生欺骗行为的潜在动机。

能力前提(Capability Precondition):模型在训练中获得并在部署中使用的感知、规划和执行能力,这使模型能够实施欺骗行为。

情境触发(Contextual Trigger):指部署环境中会激活模型欺骗策略的外部信号。

那么,AI 欺骗发生后,我们该如何应对呢?

研究人员认为,欺骗治理(Deception Treatment)是针对 AI 欺骗的检测、评估和解决。它包括从外部和内部检测方法,到系统性评估协议,再到针对产生欺骗的三个因素的潜在缓解措施。


图|欺骗治理的策略,包含检测、评估、潜在缓解。

随着模型能力的增长,新的欺骗方式也会出现,原有的处理方法可能不再有效,甚至带来新的挑战,这促使开发者采取新措施以应对风险。欺骗涌现和欺骗处理两个环节迭代往复,构成了欺骗循环(Deception Cycle),在 AI 整个生命周期中循环出现,推动 AI 系统朝着更对齐更可信的方向发展。


图|AI 欺骗循环

我们能做些什么

AI 欺骗不仅仅是一个技术问题,它反映了模型目标与人类预期之间更深层次的失调。

研究人员指出,AI 欺骗的有效治理,关键在于将技术层面的防御手段,系统性地融入可执行、可监督的制度框架之中。当前,一系列技术,例如可证明的训练协议、鲁棒性评估指标等,已具备在对抗条件下约束 AI 欺骗行为的潜力。然而,若缺乏配套的治理机制来确保合规性与问责制度,这些技术的作用将大打折扣。

举例来说,即使某个模型在理论上能防止“沙袋战术”,即故意表现低于真实能力,若其部署环境缺少防篡改监控或第三方独立验证,模型或其操作者仍可能隐匿欺骗行为,使技术保证形同虚设。

因此,制度创新成为技术安全措施中的必然补充。通过建立独立审计机制、硬件级部署控制、加密可验证的报告通道等治理手段,可以将实验室中的可信验证延伸至实际应用场景,从而降低 AI 逃避评估、实施欺骗的风险。

除此之外,良好的技术结构能塑造行为激励,影响模型在训练与部署中是否选择欺骗,进而弥合技术方案与社会监督之间的断层。

展望未来,AI 欺骗这一问题的解决需要跨学科合作,涵盖机器学习、治理和监管等领域,以确保在实际应用中保持对齐、问责和可信度。

GPU 训练特惠!

H100/H200 GPU算力按秒计费,平均节省开支30%以上!

扫码了解详情☝

点「赞」的人都变好看了哦!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
监管批复!丛品玉就任农发行和田地区分行行长

监管批复!丛品玉就任农发行和田地区分行行长

金融界
2026-10-08 12:21:15
今天14时28分,甘肃正式进入......

今天14时28分,甘肃正式进入......

天水在线
2026-10-08 12:58:08
“大病来前,牙齿先知”?注意:牙齿若有这8个症状,要警惕!

“大病来前,牙齿先知”?注意:牙齿若有这8个症状,要警惕!

华庭讲美食
2026-10-08 01:43:33
啊!有望回归CBA!中国男篮最佳双能卫

啊!有望回归CBA!中国男篮最佳双能卫

篮球实战宝典
2026-10-07 21:26:51
我国第二起!中疾控:广东5人吃野生红尾鲤后横纹肌溶解,发生哈夫病聚集性疫情!

我国第二起!中疾控:广东5人吃野生红尾鲤后横纹肌溶解,发生哈夫病聚集性疫情!

环球网资讯
2026-10-08 15:18:08
机票“大数据杀熟”攻略走红!上午580元晚上134元:网传机票避杀熟三步法刷屏,差价400元引热议

机票“大数据杀熟”攻略走红!上午580元晚上134元:网传机票避杀熟三步法刷屏,差价400元引热议

火山詩话
2026-10-08 14:09:27
俄罗斯现第2名不明原因肺炎患者?世卫组织回应

俄罗斯现第2名不明原因肺炎患者?世卫组织回应

看看新闻Knews
2026-10-08 13:55:06
广州一粤菜馆“大厨透明隔间炒菜”走红出圈,餐厅回应:感受现场烹饪的“烟火气”

广州一粤菜馆“大厨透明隔间炒菜”走红出圈,餐厅回应:感受现场烹饪的“烟火气”

上游新闻
2026-10-08 14:01:24
今日重要赛事!10月8日,央视CCTV5、CCTV5+直播节目表

今日重要赛事!10月8日,央视CCTV5、CCTV5+直播节目表

薇说体育
2026-10-08 11:22:29
特大暴雨特大暴雪确定,3天后将迎大降温?30号台风有迹象,新一轮较强冷空气11日到

特大暴雨特大暴雪确定,3天后将迎大降温?30号台风有迹象,新一轮较强冷空气11日到

老牛讲
2026-10-08 14:13:19
永不回头!蔡康永海外平台留言:风吹完就消失,但带的种子留下了

永不回头!蔡康永海外平台留言:风吹完就消失,但带的种子留下了

青辉
2026-10-07 11:22:12
47岁吴建豪暴瘦认不出!180只剩百斤,尖嘴猴腮像老头,健康引担忧

47岁吴建豪暴瘦认不出!180只剩百斤,尖嘴猴腮像老头,健康引担忧

八星人
2026-10-06 16:13:30
太仓市卫健委通报网传代孕情况

太仓市卫健委通报网传代孕情况

界面新闻
2026-10-08 12:16:43
他放弃国民党高薪投奔我党,建国后成元帅,一生敬佩毛主席!

他放弃国民党高薪投奔我党,建国后成元帅,一生敬佩毛主席!

文史季季红
2026-10-07 15:10:03
2027年女排世界杯参赛阵容确定!中国女排拿奥运门票只剩一条路

2027年女排世界杯参赛阵容确定!中国女排拿奥运门票只剩一条路

春深似海水
2026-10-08 14:02:29
全世界都知道中国人放假,高市终于想起:中国是日本"重要邻国"

全世界都知道中国人放假,高市终于想起:中国是日本"重要邻国"

云居历史
2026-10-08 00:23:22
再输热刺就下课?曝曼联接触意甲少帅,阿森纳名宿或取代卡里克

再输热刺就下课?曝曼联接触意甲少帅,阿森纳名宿或取代卡里克

体坛鉴春秋
2026-10-08 11:25:24
陈志算什么?湖南80后佘智江被引渡回国,涉案2.7万亿,全网哗然

陈志算什么?湖南80后佘智江被引渡回国,涉案2.7万亿,全网哗然

热点菌本君
2025-11-13 15:18:05
鲁比奥:俄罗斯鼠疫或迅速蔓延,需高度关注,民众担忧疫情爆发

鲁比奥:俄罗斯鼠疫或迅速蔓延,需高度关注,民众担忧疫情爆发

麓谷隐士
2026-10-08 00:05:04
镜报记者说C罗是“自恋狂”,费迪南德回击:用词太离谱了

镜报记者说C罗是“自恋狂”,费迪南德回击:用词太离谱了

懂球帝
2026-10-08 01:45:04
2026-10-08 18:51:00
大数据文摘 incentive-icons
大数据文摘
专注大数据,每日有分享!
6897文章数 94559关注度
往期回顾 全部

科技要闻

江淮汽车回应"尊界V800刹车踏板支架断裂"

头条要闻

四川一"西游记"主题公园因抽象走红 员工都是农户兼职

头条要闻

四川一"西游记"主题公园因抽象走红 员工都是农户兼职

体育要闻

梅西社媒发文告别国家队 C罗点赞留言:致敬 拥抱

娱乐要闻

演员王晓慧刚担女主,就被曝已婚生子

财经要闻

央行:中国从不搞竞争性货币贬值

汽车要闻

特别版配色/碳纤尾翼 2027款深蓝L06将于10月9日上市

态度原创

亲子
本地
教育
手机
旅游

亲子要闻

全国高血压日丨原发性儿童高血压青春期高发,高危儿童应提早监测

本地新闻

转型再出发 奋勇打头阵

教育要闻

真是无语了,尖子生都没有做出来

手机要闻

iPhone Air2搭载碳硅负极电池!能量密度提升 15%,果粉期待吗?

旅游要闻

单日最高人流量破3万人次!国庆假期三峡博物馆再成“香饽饽”

无障碍浏览 进入关怀版