网易首页 > 网易号 > 正文 申请入驻

当AI模型被按下暂停键|深度报道

0
分享至


原文发表于 《科技导报》2026年第12期科技新闻-深度报道

当AI模型被按下暂停键:美国限制外国公民访问Anthropic 2款模型,AI模型开始进入出口管制视野


大模型因为“越狱”问题被限制访问

(图片来源:linkedin)


1 模型访问权与“越狱”风险之争


2026年6月12日,美国人工智能公司Anthropic宣布,因美国政府下达国家安全指令,公司暂停客户访问Claude Fable 5和Claude Mythos 5。限制对象包括美国境外用户、身处美国的外国公民,以及Anthropic内部的外籍员工。由于短时间内无法逐一核验用户身份,公司暂时关闭了所有客户的访问权限。

这不是一次普通的产品下线。过去几年,美国对人工智能的出口限制主要针对高端芯片、先进制程设备和云算力。此次事件表明,监管对象正在进一步延伸到模型访问权。前沿模型提供的代码分析、漏洞发现和科研辅助能力,也开始被纳入国家安全审查。

Anthropic在声明中说,美国政府担心Fable 5的安全措施可能被“越狱”,从而让用户获得原本受限的网络安全能力,包括发现软件漏洞。所谓“越狱”,是指用户通过特殊提示词、多轮对话、角色扮演、任务拆解、编码转换或上下文诱导等方式,绕过模型内置的安全防护机制,使模型回答原本应当拒绝的问题,或执行原本受限的操作。与传统软件漏洞不同,大模型“越狱”往往不表现为单一代码缺陷,而是与提示词设计、模型对齐程度、上下文理解、工具调用权限和应用场景共同相关。

Anthropic对此持不同意见。该公司称,政府列举的案例只是少量已知的低级别漏洞,其他公开模型同样可能发现这些问题,尚不足以证明Fable 5构成特殊风险。

对于政府与企业争论的模型“越狱”风险,北京邮电大学网络空间安全学院教授张熙在接受《科技导报》采访时表示,美国政策界高度重视模型越狱攻击,是因为“越狱”可能让模型绕过安全限制,回答或执行原本被禁止的高风险请求。其中尤为关键的是CBRN领域,即Chemical(化学)、Biological(生物)、Radiological(放射)、Nuclear(核)相关的核生化放射安全风险。相关风险一旦被模型能力放大,可能降低恶性事件的执行门槛,对国家安全造成严重威胁。

张熙指出,现实中的安全事件已经提示了这类风险的严肃性。例如,美国现役军人Mattew Lirelsberger在特朗普国际酒店门前爆炸案中,咨询ChatGPT自制炸弹。这说明,当模型能够在高风险知识、操作步骤和执行建议之间建立连接时,“越狱”就不再只是“回答不当”的内容安全问题,而可能演变为现实世界安全风险。

争议由此落到了一个很难回答的问题上:模型具备什么能力,才需要限制访问?在张熙看来,能否防住越狱攻击,是模型上线前红队测试的核心内容,也是美国相关AI安全政策重点关注的问题。如果一个模型在高风险场景下难以抵御越狱攻击,就可能成为政府部门限制访问的理由。当前,通用越狱攻击已经成为各大模型重点防守的对象,但窄场景、非通用的“越狱”方法仍然很难完全防住,这也是前沿模型安全评测面临的主要难题之一。

与此同时,技术评估的不确定性也为外部力量介入提供了空间。Axios、Reuters、《Fortune Magazine》等媒体援引知情人士报道称,Amazon公司曾向美国政府官员表达对Fable5/Mythos模型安全风险的担忧。Amazon公司既是Anthropic的重要投资方,也是云计算和人工智能基础设施市场的主要参与者。这意味着围绕模型安全的争议,已经从技术判断延伸到企业竞争与行业话语权之争。


2 攻防同源与智能体带来的新风险


在网络安全领域,发现漏洞本身并无明确的攻防属性。模型既可以帮助能源、电信、金融和医疗机构检查代码、定位漏洞并生成修复建议,也能被用来批量扫描目标、设计攻击路径,加快漏洞利用。相同的底层能力,可能服务于完全相反的目的。

复旦大学计算与智能创新学院张晓寒副研究员指出,大模型在代码解析、漏洞研判、概念验证代码构造和补丁校验等方面具有攻防通用性。在使用方式上,防御者关注漏洞定位与修复,而攻击者则试图规避安全检测、隐蔽入侵痕迹、留存持久权限,自动化落地全链路入侵行为。由于攻击者可以通过拆解任务、分步提问绕过限制,模型风险评估不能只看单次输出,还需考虑连续任务能力、工具权限和使用场景。

这也是大模型风险难以沿用传统软件漏洞标准定级的原因。“越狱”行为会随着提示词、上下文和工具环境变化而变化,使风险呈现动态特征。

与此同时,智能体的出现进一步放大了风险。新一代模型接入智能体框架后,可以调用工具、访问代码库、联网检索并持续执行复杂任务。复旦大学副研究员戴嘉润指出,智能体的攻击能力由模型与框架共同决定,一旦具备工具调用和系统操作权限,模型能力就可能被整合为完整攻击流程。

根据其团队自2024年以来对境内外大模型及智能体攻防能力的监测,戴嘉润建议,首先应对基座模型进行能力分级。前沿模型在代码理解、漏洞定位、利用链推理和长程任务规划方面进步明显,即使只配备较简单的智能体框架,也可能对真实软件系统发起自主攻击。

但只管模型还不够。戴嘉润认为,还应评估“模型+智能体框架”组成的完整系统。真正影响风险大小的,往往是模型能够调用什么工具、接触哪些数据,以及是否具有联网和系统操作权限。未来的治理对象应当包括模型、工具、权限和运行环境,而不是孤立的模型接口。

访问限制确实可能带来一定的安全收益。张晓寒认为,它可以减少低门槛攻击者批量获得自动化漏洞发现和利用能力的机会,减缓攻击技术扩散。然而,代价也很现实。攻击者可以继续使用私有部署的开源模型和地下工具,合规研究人员、中小企业安全团队和开源项目维护者却可能失去先进模型的帮助。管制若主要约束守规矩的使用者,反而可能削弱漏洞发现和修复能力,进一步拉大攻防差距。


3 地缘竞争与AI治理规则重塑


美国政府的这次指令表明,前沿模型的访问权限已经不再完全由企业和客户之间的合同决定。国籍、所在地、合作伙伴身份和安全审查,都可能成为决定模型能否使用、开放到什么程度的条件。

这一变化也为G7期间有关“可信伙伴访问美国先进人工智能模型”的讨论提供了背景。美国正在考虑的并非简单关闭模型,而是建立分层访问制度:本国和被认定为可信的伙伴优先获得先进能力,其他国家和地区则受到不同程度的限制。模型仍然部署在云端,却开始带有类似高性能芯片的地缘政治属性。

张晓寒认为,现有模型限制规则混合了安全判断和地缘政治诉求,其科学性、公平性以及对不同国家的适用性仍需讨论。前沿模型确有双重用途风险,但真正的安全问题不能与商业竞争、技术封锁混为一谈。

对中国来说,直接影响是海外模型服务的不确定性增加。企业和科研机构过去可以通过应用程序编程接口调用先进模型,用于代码开发、科学计算、药物设计和网络安全防御。一旦模型访问被纳入出口管制,这些服务就可能因政策变化突然中断。

戴嘉润认为,境外大模型智能体的网络攻击能力正在快速提升,中国仍处在调整网络安全布局的窗口期。一方面,需要防止国内外攻防能力出现明显差距;另一方面,也要管控智能体接入真实系统后可能带来的风险,尤其是其对基础设施、软件供应链和关键行业系统的影响。

这要求国内继续建设自主模型、推理框架和算力体系,也要补上安全评测、红队测试和行业应用规范。发展模型能力与控制安全风险并非2个先后进行的任务,模型越早进入真实生产环境,两者就越需要同步推进。

Anthropic事件或许只是开始。随着模型能力不断增强,围绕“谁能使用模型、使用到什么程度、由谁决定风险”的争论将持续存在。未来的竞争不仅在性能和成本上,也将在安全标准与治理规则上展开。

文/ 黄文光

( 综合:Anthropic、Reuters、新华网、Axios、《Fortune Magazine》 )

《科技导报》创刊于1980年,中国科协学术会刊,主要刊登科学前沿和技术热点领域突破性的研究成果、权威性的科学评论、引领性的高端综述,发表促进经济社会发展、完善科技管理、优化科研环境、培育科学文化、促进科技创新和科技成果转化的决策咨询建议。常设栏目有院士卷首语、科技新闻、科技评论、专稿专题、综述、论文、政策建议、科技人文等。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
何晴去世9月,许亚军一家拍全家福继母关心,许何的表情说明问题

何晴去世9月,许亚军一家拍全家福继母关心,许何的表情说明问题

小椰的奶奶
2026-09-03 09:03:14
别自欺欺人了,中国电车在日本市场没有一点机会,纯粹赔本赚吆喝

别自欺欺人了,中国电车在日本市场没有一点机会,纯粹赔本赚吆喝

柏铭锐谈
2026-09-01 08:47:33
特朗普发文痛批:你们再闹下去,中国要赢了!美国民众不买账

特朗普发文痛批:你们再闹下去,中国要赢了!美国民众不买账

触摸史迹
2026-09-03 11:31:16
比亚迪韩国高速被现代追尾,结果韩国网友破防了

比亚迪韩国高速被现代追尾,结果韩国网友破防了

热点科技
2026-09-01 14:52:28
侯英超:目前国乒能赢张本和松岛的只有2人!

侯英超:目前国乒能赢张本和松岛的只有2人!

最爱乒乓球
2026-09-03 00:22:53
9100万用户流失!百度的搜索帝国,正在塌陷

9100万用户流失!百度的搜索帝国,正在塌陷

大佬灼见
2026-09-02 15:53:06
谈好了!埃及和中国签约了!

谈好了!埃及和中国签约了!

故事终将光明磊落
2026-09-03 10:31:03
越南或购买法国“阵风”战机,装备战略将出现重大转变?

越南或购买法国“阵风”战机,装备战略将出现重大转变?

澎湃新闻
2026-09-02 22:10:30
苏群:李月汝因为私人护照更换,新旧护照一起给寄丢了

苏群:李月汝因为私人护照更换,新旧护照一起给寄丢了

懂球帝
2026-09-03 14:06:36
谷爱凌亲身落场回应与孙宇晨绯闻 骷髅头表情回应「This is news to me」

谷爱凌亲身落场回应与孙宇晨绯闻 骷髅头表情回应「This is news to me」

新浪财经
2026-09-01 22:33:00
从退耕还林到退林还耕,从严禁超生到鼓励三胎,到底是谁错了?

从退耕还林到退林还耕,从严禁超生到鼓励三胎,到底是谁错了?

一些小事
2026-09-03 08:57:27
孙割二怼胡锡进截图疑曝光?如果胡锡进再搅局,就放出40多页猛料,让景甜万劫不复

孙割二怼胡锡进截图疑曝光?如果胡锡进再搅局,就放出40多页猛料,让景甜万劫不复

小徐讲八卦
2026-09-03 10:09:54
贵州省公安厅厅长王冬斌已任省政府党组成员;曾任北京市公安局副局长等职

贵州省公安厅厅长王冬斌已任省政府党组成员;曾任北京市公安局副局长等职

大风新闻
2026-09-03 12:36:04
博士爸爸竟拿网上搜来资料,和医学专家叫板:网上查过了,能自愈,你们就是想多收费

博士爸爸竟拿网上搜来资料,和医学专家叫板:网上查过了,能自愈,你们就是想多收费

民生故事会
2026-09-01 18:16:58
长沙一高层住宅起火致4死2伤,事故细节披露:手机充电锂电池热失控引燃床品,户主将防盗门三重反锁,起火近20分钟找不到钥匙开门

长沙一高层住宅起火致4死2伤,事故细节披露:手机充电锂电池热失控引燃床品,户主将防盗门三重反锁,起火近20分钟找不到钥匙开门

极目新闻
2026-09-03 10:46:20
“比C罗还猛”?沃特金斯首秀破门后语出惊人:沙特超已达英超水平!

“比C罗还猛”?沃特金斯首秀破门后语出惊人:沙特超已达英超水平!

智道足球
2026-09-03 09:48:31
大快人心!坐牢20年不算完,美国法院:你的公民身份,我们收回了

大快人心!坐牢20年不算完,美国法院:你的公民身份,我们收回了

怪味历史连连看
2026-09-02 23:30:05
一而再再而三,皇马必须给我们一个交代!

一而再再而三,皇马必须给我们一个交代!

火锅局
2026-09-02 15:26:22
什么比穷更可怕?浙江义乌95后女孩,白天做跨境电商,晚上足疗技师,被同行称作跨界的神,月入不到六位数

什么比穷更可怕?浙江义乌95后女孩,白天做跨境电商,晚上足疗技师,被同行称作跨界的神,月入不到六位数

捣蛋窝
2026-09-02 22:37:46
故事:聂磊称霸青岛十几年,最后因惹上一个女人,踢到铁板就此灭亡

故事:聂磊称霸青岛十几年,最后因惹上一个女人,踢到铁板就此灭亡

红豆讲堂
2024-12-17 10:54:23
2026-09-03 15:40:49
科技导报 incentive-icons
科技导报
中国科协学术会刊
5512文章数 8381关注度
往期回顾 全部

科技要闻

大模型扎堆!谷歌刚发,Meta就跟上

头条要闻

网红村支书因女儿重度抑郁要辞职:对不起 要自私一回

头条要闻

网红村支书因女儿重度抑郁要辞职:对不起 要自私一回

体育要闻

小卡回应处罚:不知晓任何规避工资帽意图

娱乐要闻

德云社停更20天再营业!

财经要闻

再见了,期房!商品房预售制卒于2026

汽车要闻

实拍捷途旅行者7 风格更潮/混动版配上华为乾崑ADS 5

态度原创

本地
数码
艺术
时尚
公开课

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

数码要闻

ATK烈空幻影无线鼠标发布:复合碳纤维轻量化镂空,首发439.45元

艺术要闻

这才是真正的 "富婆画像"|布歇人物油画太绝了

“卡普里裤”今年秋天又流行回来了,这样穿时髦又显高!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版