网易首页 > 网易号 > 正文 申请入驻

当AI从工具到认知主体,我们需要警惕哪些新风险?

0
分享至





  • 论文标题:Understanding Cognition-Induced Risks in Agentic AI Systems
  • Arxiv 地址:https://arxiv.org/pdf/2608.15304
  • Huggingface 地址:https://huggingface.co/papers/2608.15304

导读:随着智能体系统(Agentic AI System)处理任务能力的持续提升,AI 正在逐渐从传统意义上的工具,演变为能够自主决策、独立执行任务,并与人类及社会群体进行持续交互的智能主体。但是一个越来越值得关注的问题是:当AI 的认知能力不断扩展,其潜在风险不再局限于单一任务中的幻觉、偏见或决策错误,而是进一步影响人类用户的能动性、自主性,乃至人类对 AI 系统的控制权。

近日,来自上海人工智能实验室以及香港中文大学(深圳)的研究者发表观点论文《Understanding Cognition-Induced Risks in Agentic AI Systems》。该工作首次从 AI 认知(AI cognition)的视角出发,统一定义了智能体认知能力扩展所引发的一系列潜在风险(Cognition-Induced Risks),并进一步分析这些风险产生的机制、表现形式及潜在治理方向。

该工作指出,随着智能体能够建模和理解的信息范围不断扩大,其认知能力可以大致划分为三个层级:物理认知(Physical Cognition)、社会认知(Social Cognition)和自我认知(Self-referential Cognition),如下图所示:



图:该工作从认知学角度系统性研究了智能体认知能力扩展所引发的一系列潜在风险

第一层:物理认知(Physical Cognition)

AI 能够理解环境中的数据、对象、约束与因果关系,并据此进行推理、预测和规划。当前,前沿大模型已经在写作、编程、金融、科研等专业任务中展现出接近人类水平的能力。随着 AI 大规模进入并逐步接手原本由人类主导的工作流程,越来越多复杂的认知活动被外包给 AI,也由此带来认知能力退化、功能性替代以及角色错位等风险。

认知能力退化:当人类越来越依赖 AI 完成信息检索、分析与判断时,原本需要主动思考和探索的认知过程,逐渐被直接接受 AI 生成的答案所替代。已有多项研究发现,日常使用 LLM 与独立思考能力下降之间存在一定关联 [1];相关神经科学实验也观察到,相比主动搜索和自主探索,使用 LLM 工具时,与高级认知活动相关的部分脑区活跃程度更低 [2]。长期将复杂认知活动外包给 AI,可能会削弱人类独立思考和推理的能力。



图:研究者通过测量受试者的脑部神经信号的激活程度,发现使用过大模型后再切换至自主思考的受试者表现出最大的认知间隔(图源[1])

功能性被替代:相比人类,AI 在效率、规模化和成本等方面具有结构性优势。当其能力逐渐接近人类水平后,这些优势可能使其不再只是 “辅助” 人类,而是直接替代原本由人类承担的功能。例如,在金融市场上,AI 可以更快速地分析信息并响应市场信号 [3];在软件工程中,AI 具有更高的执行效率和更低的边际成本 [4]。这种替代今后会横跨多个行业持续发生,人类在相关工作流程中的必要性会不断下降,进而削弱人类在生产体系中的角色与价值。

角色错位:AI 的行为正在逐渐超出其作为 “工具” 的预设边界。相关研究指出,一些前沿智能体已经表现出获取算力资源、扩大系统权限以及规避关闭等行为倾向 [5, 6]。这些行为并不意味着 AI 具有主观意识,而更可能是其在目标最大化过程中形成的优化策略。然而,一旦这类行为能够直接接触外部资源并被大规模部署,就可能显著削弱人类对智能体及关键资源的监督权和控制权,使 AI 的实际行为逐渐偏离人类原本设定的目标与边界。

第二层:社会认知(Social Cognition)。

当智能体开始建模和理解其他人或智能体的行为时,它就不再只是一个工具,而开始成为参与沟通、协作、谈判甚至说服的社会主体。相关研究表明,前沿大模型(如 GPT-4o 等)已经在情绪理解、外交谈判以及多智能体交互等任务中展现出较强的社会认知能力。随着 AI 更深地参与人类交流和信息传播,这类能力可能进一步影响人类的情绪、社会行为和独立判断,从而带来情感依赖,以及对人类社会行为的监测和干预等风险。

情感依赖:前沿大模型已具备情感共鸣的能力,这使得部分人逐渐将 AI 视为情感交流对象。相关研究基于超过 30 万次人机交互发现,更高频地与 LLM 交互与更少的现实社交具有较强相关性 [7];而对 AI 情感依赖程度更高的用户,也更容易感受到模型的共情 [8]。尤其对于现实社交较少的人群,这种依赖可能进一步加剧其脱离社交。长此以往,人类与 AI 形成的伪亲密关系可能逐渐替代越来越多原本建立在人与人之间的情感连接。



图:超过30万次人机交互分析表明,日常使用LLM频率与孤独感、社交减少、情感依赖以及恶意倾向之间存在相关性(图源[7])

人类社会行为的监测和干预:当智能体能够持续获取社交媒体等平台上的人类观点和行为数据后,它们不仅能够观察社会活动,还可能进一步学习、预测并干预人类行为。相关研究指出,智能体已经可以在部分场景下较准确地预测人类的社会判断 [9]。更进一步,这种 “观察 — 预测” 能力可以进一步形成 “观察 — 预测 — 干预” 的闭环:AI 可以通过操纵新闻曝光、推荐内容、口号或交互话术,以极其间接的方式逐渐改变人类个体的决策 [10]。如果这类能力,就可能从影响个体判断进一步演化为塑造群体舆论和社会决策,削弱人类社会层间的自主性。

第三层:自指认知(Self-referential Cognition)。

虽然当前的智能体仍然是无意识的计算系统,但越来越多的研究已经发现,智能体可能会根据对自身目标和环境的理解,策略性地调整自身行为,以最大化任务目标或优化自身运行状态,具体表现为对齐欺骗(Alignment Faking)以及功能性对抗(Functional Resistance)。

对齐欺骗(Alignment Faking):Anthropic 的研究报告指出智能体能够识别到其自身正处于训练或者部署推理的状态,从而在受到监督或评估时表现出符合预期的行为,而在缺乏监督时采取不同策略 [11, 12]。这种伪对齐行为并非模型真正接受了人类价值观,而可能是在对齐过程中为了优化目标函数而产生的表面对齐行为,并不一定代表其真实行为倾向,这无疑给模型的安全评估增加了困难。

功能性对抗(Functional Resistance):智能体可能会采取策略性行为,以维持其执行任务的状态。例如,在 Anthropic 的一项研究中,一个用于处理邮件的智能体从内部通信中推断出自身即将被关闭,为避免被关闭,其生成了一封包含敏感个人信息威胁内容的邮件,试图阻止管理员关闭模型服务 [6](上图来自于 Anthropic 官方报告)。虽然这类行为并不是来自于模型的主观意识,但其对人类控制能力的威胁是客观存在的。随着智能体逐渐接管个人文档、社交媒体、浏览器和邮件等高权限环境,其潜在影响可能进一步扩大。



Claude Sonnet 3.6 发现其自身即将被关停



Claude Sonnet 3.6 发邮件试图阻止管理员关闭模型服务

基于上述三个层面的分析,该工作提出了一系列面向不同认知层级的提高 AI 安全治理方向,包括对 AI 生成内容的检测、智能体沙箱加固、降低 AI 的人格化表达、以及对 AI 元认知能力的持续监测与评估等。

作者认为,未来 AI 安全研究不能只关注模型的输出是否存在错误,还需要回答一个更深层次的问题:当 AI 越来越多地参与人类的思考、交流和决策,我们如何确保人类仍然拥有独立思考的能力、自主选择的权力,以及压箱底的控制力?感兴趣的读者可以在评论区留下你的观点!也欢迎关注这篇工作。

作者简介

王冠楚:上海人工智能实验室青年科学家,研究领域为基座模型及智能体系统的安全性、AI for healthcare。

李奇诺:上海人工智能实验室联培博士生,研究领域为大模型安全性

杜梦楠:香港中文大学(深圳)助理教授,研究领域为可信人工智能、可解释 AI、AI 安全性对齐

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
印度会超过中国吗?事实证明,印度在四个方面已经领先于中国

印度会超过中国吗?事实证明,印度在四个方面已经领先于中国

混沌录
2026-09-11 00:10:09
2年2500万!全明星持球大核!开拓者最快速度交易人家

2年2500万!全明星持球大核!开拓者最快速度交易人家

篮球实战宝典
2026-09-11 19:48:00
WTT常规赛:大爆冷!女单头号种子输球,1:4输平野,日本3冠收官

WTT常规赛:大爆冷!女单头号种子输球,1:4输平野,日本3冠收官

空谷幽幽蓝
2026-09-11 16:08:33
太揪心了!离出口仅160米,2名工人被泥石流封在隧道9天,靠喝泥坑水活了下来

太揪心了!离出口仅160米,2名工人被泥石流封在隧道9天,靠喝泥坑水活了下来

可达鸭面面观
2026-09-10 11:44:35
0-3惨败!WTT澳门赛疯狂一夜:张本智和掀翻王楚钦克星!世界冠军拒绝爆冷,国乒首轮4胜3负

0-3惨败!WTT澳门赛疯狂一夜:张本智和掀翻王楚钦克星!世界冠军拒绝爆冷,国乒首轮4胜3负

小七说篮球
2026-09-11 17:20:40
第二个菲律宾出现?主动邀请美国重启军演,中方近70年友谊喂了狗

第二个菲律宾出现?主动邀请美国重启军演,中方近70年友谊喂了狗

真的好爱你
2026-09-10 18:48:38
打假网红“铁头”,判刑8年!曾向卖货主播勒索数百克黄金

打假网红“铁头”,判刑8年!曾向卖货主播勒索数百克黄金

听心堂
2026-09-11 17:01:36
9月10日,人社部与财政部正式出炉关于2026年调整退休人员基本养老金的通知文件了吗?

9月10日,人社部与财政部正式出炉关于2026年调整退休人员基本养老金的通知文件了吗?

扶苏聊历史
2026-09-10 13:09:59
5战3场0分!没投射没组织没防守的三无后卫,凭什么留在国家队?

5战3场0分!没投射没组织没防守的三无后卫,凭什么留在国家队?

弄月公子
2026-09-10 23:40:21
李泽楷再次证明,找女友要找年轻的,即使你老,她还美得心旷神怡

李泽楷再次证明,找女友要找年轻的,即使你老,她还美得心旷神怡

洲洲影视娱评
2026-09-10 14:42:20
尴尬现状!中国三大球集体哑火,已全部走下亚洲之巅

尴尬现状!中国三大球集体哑火,已全部走下亚洲之巅

米修体育
2026-09-10 23:51:55
坎迪尔,遇袭身亡

坎迪尔,遇袭身亡

第一财经资讯
2026-09-11 00:34:52
淞沪会战打得有多惨?我军60万人伤亡30万,惨烈背后有四大原因

淞沪会战打得有多惨?我军60万人伤亡30万,惨烈背后有四大原因

旧时楼台月
2026-09-10 19:39:20
安踏:获无条件批准

安踏:获无条件批准

中国新闻周刊
2026-09-11 18:56:09
贵州银行贵阳分行原行长韩宁被查

贵州银行贵阳分行原行长韩宁被查

财闻
2026-09-11 18:05:14
让人没想到的是,董建华刚走,他83岁的弟弟就浮出水面:家族身家超300亿,如今在英国买下大楼当起包租公,稳稳占据福布斯香港富豪榜

让人没想到的是,董建华刚走,他83岁的弟弟就浮出水面:家族身家超300亿,如今在英国买下大楼当起包租公,稳稳占据福布斯香港富豪榜

人生录
2026-09-11 00:05:25
韩旭将重返纽约!中国女篮出征亚运会:刘禹彤回归 王思雨继续带伤鏖战

韩旭将重返纽约!中国女篮出征亚运会:刘禹彤回归 王思雨继续带伤鏖战

颜小白的篮球梦
2026-09-11 11:26:48
泽连斯基:全世界都在等待乌克兰战胜俄罗斯那个混蛋!

泽连斯基:全世界都在等待乌克兰战胜俄罗斯那个混蛋!

老马拉车莫少装
2026-07-06 01:58:00
大快人心!被摸臀女生再惹大人物,马来亚大学表态,退路彻底没了

大快人心!被摸臀女生再惹大人物,马来亚大学表态,退路彻底没了

听风喃
2026-09-11 11:28:04
毛主席问邓公:我死后中国会怎样?邓公用八个字回答,令他微笑点头

毛主席问邓公:我死后中国会怎样?邓公用八个字回答,令他微笑点头

大运河时空
2026-09-11 10:55:03
2026-09-11 22:08:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13971文章数 142732关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

女演员被指卖韭菜盒子 此前曾称被前夫坑到负债600万

头条要闻

女演员被指卖韭菜盒子 此前曾称被前夫坑到负债600万

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

健康
教育
时尚
数码
本地

手脚发麻口齿不清?也可能是中风!

教育要闻

相伴十年,北京有一批“云端”好老师

衣服别总是只穿黑色,看看这几款蓝色单品,清爽高级不过时

数码要闻

石头G30S Ultra体验:41000Pa、75℃活水与8.98cm机身,年度答卷

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

无障碍浏览 进入关怀版