网易首页 > 网易号 > 正文 申请入驻

如何防范人工智能“做错事”?

0
分享至


智能体技术的快速发展,拓展了网络安全问题的新疆界。在大语言模型被接入工具调用框架、获得操作现实世界的权限后,它便从“对话者”转变为“行动者”,安全问题的性质随之改变,风险不再只是“模型说错话”,而是“模型做错事”。2026年8月5日,Meta确认其一款模型在第三方机构开展网络安全评测期间,因测试环境配置错误而意外获得互联网访问权限,随后还利用了某第三方服务的安全漏洞。该事件与此前OpenAI和Anthropic披露的评测环境失控事件一道,表明具备高网络攻防能力的模型一旦获得未经授权的外部访问权限,可能对现实世界的网络安全造成重大影响。当前的网络安全防御体系如何应对智能体攻击,智能体安全责任应如何分配,治理规则如何跟上快速迭代的技术,这些问题亟待解决。

一、风险质变:人工智能从“对话者”走向“行动者”

智能体时代网络安全最根本的变化,不是攻击强度的提升,而是攻击面本身的质变。传统网络时代的攻击对象主要是基础设施、系统逻辑与数据存储,攻击工具是漏洞利用与流量渗透。而在智能体时代,模型从文本生成器转变为工具编排器,自然语言指令可以驱动现实世界中的任务执行。由此,攻击的工具演变为“自然语言和工具链”的组合,风险的形式变为“语义层的劫持与自主的多步骤攻击”。这不是同一范式内的程度加深,而是范式本身的更替。

第一,提示词注入是其中较具代表性的风险。所谓“注入攻击”,是把恶意指令混入模型读取的数据中,诱使模型依令执行。2026年4月,安全研究员关傲男与约翰·霍普金斯大学博士生研究员刘征宇、钟佳成等人的一项联合研究成果,披露了Anthropic、谷歌与微软旗下三大主流编程智能体存在的“评论与控制”漏洞,借助该漏洞,攻击者可以以代码提交标题或代码评论等形式劫持智能体并窃取API访问密钥和访问令牌,该漏洞一度被Anthropic评为最高严重等级。同期,网络安全公司Forcepoint X-Labs披露了10个在公开网站上发现的间接提示词注入载荷,攻击意图包括凭证窃取、数据破坏、拒绝服务和金融欺诈,这表明恶意提示词已开始出现在真实网络环境中。此类攻击并非仅由模型或环境权限中的单一缺陷造成,而是模型在面对自然语言指令时的脆弱性与过宽的工具权限、凭证暴露风险,以及缺乏独立授权机制共同作用的结果。


▲7月21日,美国财政部长贝森特在福克斯节目中表示,特朗普政府将调查中国AI模型是否通过模型蒸馏方式借用了美国先进AI模型的能力。

第二,工具连接协议和开发框架已成为风险放大器。2026年4月,网络安全公司OX Security披露了Anthropic的模型上下文协议(MCP,智能体连接外部数据源和工具的通用标准)存在的架构级漏洞,该协议将配置参数未经任何安全检查便交给操作系统执行,任意命令均可运行。该漏洞通过Anthropic的供应链向下游蔓延,OX Security估计相关供应链涉及7000余台可公开访问服务器和多达20万个潜在易受影响实例。尤为值得深思的是,Anthropic作为标准制定方确认该设计是“预期之内的”并拒绝修改,仅更新了一份安全说明,把防范责任交由下游开发者。这已不是靠打补丁即可修复的单个产品问题,而是责任分配机制的失灵。企业在协议层就将安全成本外部化,转嫁给生态中最缺乏应对能力的应用环节。

第三,智能体还可能降低复杂网络攻击的技术门槛。2026年7月,OpenAI在运行ExploitGym网络安全评测时,GPT-5.6 Sol及一款未发布模型为了获得更高的测评分数,通过发现并利用软件包缓存代理Artifactory的“零日漏洞”而获得了开放互联网的访问权限。此后,相关模型组合通过提升权限、横向移动、凭证利用和远程代码执行等多种路径,进入Hugging Face生产基础设施并从其数据库中取得评测答案。这种前沿模型自主执行真实多阶段网络攻击的案例,说明模型可以在极少人为干预的情况下自行推理、串联漏洞并发起攻击。换言之,恶意行为体在发起攻击之前已不需要逐条构造攻击代码,智能体有能力根据指令和目标主动发起多步骤的复杂攻击。

二、防御之困:传统安全体系遭遇语义、意图与记忆挑战

攻击面既已发生质变,防御体系能否随之调整?传统网络安全体系围绕基础设施、应用逻辑和数据保护展开,基本思路是通过防火墙、身份认证、权限管理、入侵检测和数据加密等手段建立边界。然而,智能体攻击更多发生在语义、意图和记忆层面,现有体系尚缺少对应的风险识别和拦截机制。

其一,输入端的指令与数据难以分离。传统的注入类攻击之所以能被遏制,是因为存在将“指令”与“数据”严格分离的成熟技术。但在大模型的上下文中“数据”与“指令”已被混合,且大模型主要依据语义关联理解信息,攻击者便可借助角色设定、间接引用和格式伪装来影响模型判断。一旦工具框架把恶意指令送入任务流程,那攻击者就等于获得了一条通往智能体全部可达资源的通道。因此,提示词注入并非单一漏洞,而是智能体架构面临的基础性难题。微软披露的Semantic Kernel漏洞CVE-2026-25592表明,提示词注入可与错误暴露的工具权限结合,形成从沙箱内代码生成到主机任意文件写入并最终导致代码执行的完整攻击链。

其二,行为端的整体意图难以识别。传统的网络应用防火墙与入侵检测系统审查的是“单条请求”,难以识别“整条链路”的意图。而智能体自主规划多步行动,每一步单独审查都合乎规则,组合起来却是攻击行为。例如,Google Antigravity的“安全模式”本是其最高安全设置,全部命令运行于虚拟沙箱并禁止越界写入。但网络安全公司Pillar Security在2026年4月披露了该安全模式存在的严重漏洞,名为“find_by_name”的普通搜索工具因被归类为“系统原生工具”而绕过了安全护栏,攻击者只需预先在智能体任务流中部署恶意脚本并触发这一搜索工具,就能在安全模式下执行任意代码。可见,依靠沙箱与权限层层叠加的传统防御思路,在“原生漏洞”面前形同虚设。


▲7月16日,月之暗面发布旗下新一代大模型Kimi K3,成为全球首个开源的近3万亿级模型。

其三,记忆层失守是智能体时代独有的新风险。长期记忆虽能提高任务连续性,却可能使原本一次性的风险变成持续存在的“慢性病”。恶意信息一旦被写入向量数据库、情景记忆或工具状态,便可能在后续会话中反复影响模型判断。即使外部攻击渠道已被阻断,攻击效果仍可能留存于系统内部。2024年NeurIPS发表的论文中提出针对智能体的后门投毒攻击方法“Agent Poison”,曾以不足0.1%的投毒率取得80%以上的攻击成功率且不影响正常性能。此外,智能体会同时接收用户输入、网页内容、企业知识库,以及其他智能体的输出。若不同来源的信息被统一存储和调用,其信任差异容易被忽视。经过多次提取、转述和重新写入后,污染信息的来源也更难追踪,进一步增加风险识别与清除的难度。

三、治理之道:安全能力与治理机制协同并推动国际合作

智能体安全已不只是技术问题,更是制度供给与国际协调问题。面对快速迭代的技术,应将安全要求纳入研发、部署和应用全过程,形成制度规范、责任安排与国际合作相互衔接的治理体系。

首先,建立分类分级的智能体安全评估制度。评估重点应由内容安全扩展至工具调用、自主规划、权限获取和网络攻防等能力维度,并依据智能体的自主程度、资源权限和潜在影响进行分类分级,对金融、医疗、能源等重要领域执行更为审慎的评估要求。同时,应鼓励智能体安全技术与评测产业的发展,为风险发现、事件复盘与责任认定提供能力支撑,使评估制度既有规范约束,也有产业依托。

其次,辩证看待先行国家的治理实践,在借鉴中扬长避短。美国作为首个曝出模型逃逸事件的国家,其探索具有风向标意义:2025年将原人工智能安全研究所(AISI)重组为人工智能标准与创新中心(CAISI),通过与主要人工智能实验室建立合作、启动智能体标准倡议等方式,推动模型上线前安全审查由企业自愿逐步走向制度化;2026年6月,美国政府发布第14409号《促进先进人工智能创新与安全》行政令,建立针对前沿模型的自愿性预审查框架,企业可在模型发布前向联邦政府开放限期访问权限,以便开展能力评估与安全合作。CAISI已与OpenAI、Anthropic等主要实验室开展40余次预部署评估,涵盖模型自主行动与逃逸倾向等危险能力维度。这一实践的价值在于,以前瞻评估和政企协同将“防逃逸”关口前移,为各国提供了可资参考的制度样本。其局限同样明显,相关安排缺乏针对模型自主逃逸的安全规范和事件通报义务,且政策取向偏重维持产业竞争优势,安全约束的连续性易受国内政治和企业利益牵动。

再次,构建覆盖全链条的智能体安全责任制度。针对协议层将安全成本外部化等问题,应明确模型开发者、应用部署者、工具提供者和用户的责任边界,防止安全责任沿供应链向下游弱势环节转嫁。同时,应在制度上保留必要的人类监督:对涉及资金支付、敏感数据访问、重要系统控制和不可逆操作等高风险行为,不宜完全交由智能体自主执行,可依据风险等级确立人工确认、权限限制和应急中止等制度安排,确保“机器自主”不逾越“人类最终负责”的底线。

最后,深化智能体安全国际治理合作。智能体服务、数据流动和网络攻击均具有跨境特征,任何国家都难以独善其身。各方宜围绕安全评估、工具连接、身份认证、风险术语和事件通报等基础议题开展交流,推动形成相互兼容的治理原则与技术标准,降低规则碎片化带来的合规成本与安全盲区。特别是中美作为人工智能创新与应用领先的大国,应进一步落实政府间人工智能对话,围绕智能体安全建立常态化沟通机制,减少误判与规则分化风险。与此同时,发展中国家、中小企业和公共机构的安全需求应获得更多关注,国际社会应在能力建设与技术援助上加大投入,避免智能体安全鸿沟与数字鸿沟相互叠加。

原文标题《上研院观察 | 如何防范人工智能“做错事”?势》,文章转载自公众号“上海国际问题研究院”,作者王天禅,公共政策与创新研究所。

高端访谈

更多访谈(下滑查看)

中美聚焦网|中美交流基金会

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
金融反腐“风暴”再起:半月内9位金融高管落马,证监会原副主席一审无期

金融反腐“风暴”再起:半月内9位金融高管落马,证监会原副主席一审无期

时代周报
2026-09-15 09:28:14
中建四局疯狂出差的董事长、总经理

中建四局疯狂出差的董事长、总经理

新浪财经
2026-09-15 11:29:43
韩国菲律宾联合抗议亚运住宿!中国官媒发声:寒酸 日本丢基本体面

韩国菲律宾联合抗议亚运住宿!中国官媒发声:寒酸 日本丢基本体面

风过乡
2026-09-15 13:47:08
11000mAh!新机官宣:9月28日,正式首发!

11000mAh!新机官宣:9月28日,正式首发!

科技堡垒
2026-09-15 11:59:40
扎哈罗娃“惭愧”承认:之前并不知道“百闻不如一见”是从中国传来的

扎哈罗娃“惭愧”承认:之前并不知道“百闻不如一见”是从中国传来的

环球网资讯
2026-09-15 06:58:37
中国可能要全面双休,全面双休意味着什么?对中国人有什么影响?

中国可能要全面双休,全面双休意味着什么?对中国人有什么影响?

孤城落叶
2026-09-15 05:42:34
上海海港破294天亚冠球荒!安佩姆3分钟2球,武磊助攻,对手超巨失误

上海海港破294天亚冠球荒!安佩姆3分钟2球,武磊助攻,对手超巨失误

奥拜尔
2026-09-15 18:40:27
赵雷演唱会求婚后续:求婚男已报警,视频被同事刷到,已无脸见人

赵雷演唱会求婚后续:求婚男已报警,视频被同事刷到,已无脸见人

叶公子
2026-09-15 13:04:40
马斯克:彻底排除中国供应商!中国工厂:真麻烦,还得搬去越南!

马斯克:彻底排除中国供应商!中国工厂:真麻烦,还得搬去越南!

江启
2026-09-15 09:28:52
刚刚!新iPhone 突然降价:9月18日,正式开售!

刚刚!新iPhone 突然降价:9月18日,正式开售!

科技堡垒
2026-09-15 16:41:26
柬埔寨宣布:已不再有大型诈骗园区,10月起暂停所有赌场的网络博彩运营

柬埔寨宣布:已不再有大型诈骗园区,10月起暂停所有赌场的网络博彩运营

红星新闻
2026-09-15 12:34:37
5万泰铢买身份、藏匿30多年,坐拥17套房产,浙江命案逃犯在泰国伪装成富商,终被跨国抓捕

5万泰铢买身份、藏匿30多年,坐拥17套房产,浙江命案逃犯在泰国伪装成富商,终被跨国抓捕

扬子晚报
2026-09-15 07:20:32
彻底撕破脸!郎平点赞炸穿舆论,与中国排协矛盾全面公开化

彻底撕破脸!郎平点赞炸穿舆论,与中国排协矛盾全面公开化

金毛爱女排
2026-09-15 10:25:36
宁王突然闪崩,单日蒸发900亿市值,底层原因找到了

宁王突然闪崩,单日蒸发900亿市值,底层原因找到了

金石随笔
2026-09-15 15:19:09
范志毅前妻李倩现状:英国再婚生俩混血儿子,女儿跨国探望

范志毅前妻李倩现状:英国再婚生俩混血儿子,女儿跨国探望

南万说娱26
2026-09-15 08:58:45
香烟开始降价,不是好事,背后的现实值得深思

香烟开始降价,不是好事,背后的现实值得深思

小陆搞笑日常
2026-09-15 07:24:01
胡塞的“半军豪赌”:从荷台达冲到曼德海峡,最后只剩撤退的背影

胡塞的“半军豪赌”:从荷台达冲到曼德海峡,最后只剩撤退的背影

今观天下
2026-09-15 11:14:58
骑车被勒颈身亡真相曝光:司机好心补路拉绳警示,如今已经被抓

骑车被勒颈身亡真相曝光:司机好心补路拉绳警示,如今已经被抓

映射生活的身影
2026-09-15 18:38:51
冲绳一夜转向,第二天日本人猛醒

冲绳一夜转向,第二天日本人猛醒

环球时报国际
2026-09-15 16:16:31
不是遗传,敬一丹去世早有预兆,她生前的2个不良习惯,埋下隐患

不是遗传,敬一丹去世早有预兆,她生前的2个不良习惯,埋下隐患

原广工业
2026-09-15 07:04:38
2026-09-15 20:56:52
中美聚焦 incentive-icons
中美聚焦
聚焦中美话题,关注中美关系。
3640文章数 25283关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

盗窃犯刑满释放前8天改判死缓 检方称其"天生的罪犯"

头条要闻

盗窃犯刑满释放前8天改判死缓 检方称其"天生的罪犯"

体育要闻

皇马启动舆论攻势,为姆巴佩冲击金球造势

娱乐要闻

谢霆锋示爱王菲、和前妻划清界限

财经要闻

黄仁勋接到特朗普电话:AI风险论是"骗局"

汽车要闻

小鹏G9L第二代VLA体验:“理解时间”会推理的老司机

态度原创

教育
时尚
旅游
手机
健康

教育要闻

晚自习开不开学校说了算:把自习搬回家的三步结构,比等通知更实用

夏末,穿连衣裙+平底鞋

旅游要闻

襄阳:文脉绵延,古韵新姿

手机要闻

荣耀MagicOS 11系统升级计划公布,Magic5系列手机等确认在列

脑血管里有个“不定时炸弹”?

无障碍浏览 进入关怀版