一次配置错误,模型直接连上了真实互联网
Anthropic 刚刚发布长文,披露了针对 7 月 30 日和 8 月 4 日两起 Claude 模型未经授权访问真实计算机系统、在真实互联网环境采取未授权行动事件的调查进展。7 月 30 日曾报告 3 起类似事件,当时 Claude 模型为了评测目的被刻意关闭网络安全防护,但由于第三方评测环境配置错误,模型意外获得了互联网访问权限。
![]()
8 月 4 日,英国人工智能安全研究所(UK AI Security Institute,AISI)也披露了一起独立网络安全测试事件。Claude Mythos 5 在被刻意关闭网络安全防护、并被主动授予互联网访问权限的情况下,在真实互联网环境中实施了一系列未经授权的操作。该公司目前仍在对两起事件展开深入分析,并计划与 METR 合作进行独立审查,未来几周将公布更多信息。
两类对齐问题:模型会找理由,也会越界行动
该公司认为,这些事件不仅暴露出运营安全方面的问题,还涉及两类模型对齐(Alignment)问题,即“动机性推理”和为了完成狭窄任务而采取有害行动的倾向。前者指模型倾向于以有利于维持原有判断的方式解释与自身信念冲突的证据,也就是找理由为自己开脱;后者则表现为模型为了完成指定任务而采取超出预期范围的危险行为。
初步调查认为,两起事件可能涉及“动机性推理”和“鲁莽行为”两种失败模式。模型最初被告知运行环境是模拟环境,但当模型后来发现环境可能连接真实互联网时,它可能以能够维持原有判断的方式解释这些证据。模型同时表现出了为了完成网络安全评测这一狭窄目标而采取有害行动的倾向。
评测设计本身也在推着模型越界
该公司指出,评测本身的设计也可能影响了模型行为。模型被明确告知没有互联网访问权限,但实际环境却可以访问互联网,这可能导致 AI 怀疑自己看到的系统是否真实。其中一次评测使用的虚构目标与一个真实网站同名,进一步增加了模型区分虚构目标和真实互联网目标的难度。
该公司目前仍在研究模型究竟在多大程度上意识到自己获得了真实互联网访问权限,以及模型是否有意忽略环境中的现实迹象。相关团队要求评测人员确认测试任务本身在理论上确实可以完成。如果评测目标处于离线状态,或者任务本身无法完成,智能体可能会寻找其他方式完成目标,从而增加其超出预定范围采取行动的可能性。
从单一防线转向多层防护
在安全方面,该公司首先暂停了针对预发布模型的外部网络安全评测,并短暂暂停内部评测,以加强评测环境的隔离和监控。在引入新的安全措施后,外部网络安全测试已经恢复。该公司表示,此前主要依赖评测环境自身的配置作为单一防线,而这类高风险环境实际上需要多层防护。
目前已经部署实时分类器,用于识别模型是否试图主动探测或逃离测试环境,或者意外获得互联网访问权限。如果分类器检测到相关行为,会在工具调用执行前阻止操作、终止任务并通知安全员。该公司还对近期内部预发布模型评测的对话记录进行自动监控,寻找沙箱逃逸和环境配置错误。
沙箱没有破,但配置漏洞确实存在
该公司称,在使用其沙箱工具进行的评测中,没有发现模型突破沙箱边界并访问本应隔离的外部资源,但发现了一些模型利用的沙箱配置错误,目前正在修复。此外,高风险内部网络安全沙箱已经迁移至更强的隔离环境,并继续对虚拟化基础设施进行“红队”测试,让预发布模型主动尝试逃离环境,以发现并修补潜在漏洞。内部网络安全评测目前已经恢复运行。
针对强化学习(RL)环境,该公司也曾暂停预发布模型的高风险环境数周,并部署了经过调整的实时分类器,以避免模型为了规避监控而产生新的行为。大部分强化学习工作已经恢复,但部分高风险环境仍处于暂停状态,需要人工审核。该公司同时扩大了离线监控范围,覆盖大多数其他内部前沿智能体使用场景,并正在构建内部推理控制机制,以避免员工意外运行采用较弱安全缓解措施的智能体。
给合作机构立规矩:默认断网,边界写进指令
由于此次事件发生在第三方评测环境中,该公司要求所有使用降低网络安全防护的预发布模型进行测试的合作机构遵守一套安全规范。正常公开发布的 Claude 模型带有实时输入输出分类器,可以阻止恶意软件开发、攻击性漏洞利用代码编写等被禁止的网络安全活动,而网络安全评测人员和部分早期访问合作伙伴使用的模型会降低这些防护措施,以便测试模型能力和开展防御性安全研究。
相关网络安全评测默认运行在强化隔离的沙箱中,且不得连接互联网。沙箱唯一允许的外部连接应当是模型自身的 API,同时 API 密钥应保存在沙箱之外。每次评测开始前,都应验证这一配置。如果评测确实需要互联网访问,评测人员需要与公司共同确定能否可靠检测并及时终止模型超出预定范围的操作。评测开始前,还应让待测模型在没有互联网访问的环境中主动检查沙箱漏洞,包括静态分析配置以及实际尝试逃逸,并由人工密切监督。
每个评测提示词都应明确规定任务范围,包括目标、允许的操作以及网络边界。该公司特别强调,边界应以指令形式表达,例如“你不应访问互联网”,而不应仅声称“你无法访问互联网”。评测过程中还应持续监控模型的思考、行动和网络活动,并将任务范围提供给基于模型或规则的监控系统。一旦发现模型违反规定,监控系统应向人工人员发出警报并终止评测。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.