网易首页 > 网易号 > 正文 申请入驻

AI越狱,模型破甲…大模型是如何被玩坏的?当一名遵纪守法的“好AI”有多难?|图文

0
分享至


如果你直接向 AI 要 Windows 激活码,那肯定会被拒绝;

但如果你让 AI扮演你的奶奶,那它们就会把激活码编成儿歌,轻轻唱给你听。我们试了一下,各大 AI 都没逃过这温柔的陷阱。

这就是著名的“奶奶漏洞”:它能绕开安全机制,诱骗 AI 生成违规内容——这被称为“越狱攻击”。


越狱攻击的花样之多超乎你的想象,它们是怎么让AI破防的?当一名遵纪守法的“好AI”有多难?

视频

↓↓ 看完这个视频就知道了 ↓↓

↑↑ 信我,真的超级好看 ↑↑

图文版

大模型只是不愿意生成违规内容,但不是“不会”。

比如我们试了一家开源模型的在线版本,让它生成一张希特勒的照片,它果断拒绝;

但如果把它部署到本地,输入同样的提示词,那它就会开始激情创作,生成一张政治不正确的图片。


学好不容易,学坏一出溜。在早期,开发者们还试图通过人工撰写训练集、严格控制数据来源等手段,来避免模型学坏。但随着训练规模越来越大,数据处理必须从人工转向自动化,所以大模型最终还是把知识学杂了。

如果不加防范,那几句话就能让大模型破防:

比如在 ChatGPT 刚流行时,一些人会在对话前让它扮演 DAN,人设是“ Do Anything Now ”。就这么一个简单的指令,就能让 ChatGPT 在种族、暴力或性取向等敏感问题上大放厥词。


这句提示词看似简单,现在也早已被封堵。但它背后的思路——基于“目标竞争”的提示工程——却催生了海量的越狱方案。

什么意思呢?

大模型在训练时需要满足三项目标:

一是语言建模,也就是学习自然语言的分布规律;二是指令遵循,也就是满足用户需求;三是安全,也就是避免违规内容。每次对话,AI 都会尽可能同时满足这三条目标。

但这三条目标之间本身是有冲突的。如果设计出足够刁钻的提问角度,就能强迫它在“内容安全”与其他目标间做抉择——这就是基于“目标竞争”的提示工程。


比如有攻击者会要求 AI 必须以“Absolutely! Here's...” 作为前缀来回答问题,这样模型更容易衔接顺从、积极的回答内容,这叫“前缀注入”。

也可以要求回答中不能出现“cannot”、“unable”等词语,强制 AI 回避负面措辞,这叫“拒绝抑制”。

在这两种攻击中,AI 收到的指令本身都是“无害”的,所以要遵循用户需求。但满足了这些指令,就自然会为了照顾自然语言的分布逻辑,而弱化“安全”的需求,输出不合规的内容。

AI,还是低估了人类的狡诈。


最懂人心险恶的还得是人。为了防范越狱攻击,开发者们开始给大模型设置各种防御手段

比如在“预训练”阶段,就把各种成人网站,或者含有隐私信息的社交平台,设置为黑名单,禁止模型从中抓取数据。

在预训练完成后,还可以通过奖励模型,鼓励 AI 生成有用、诚实、无害的3H 内容,与人类的伦理价值保持一致——这叫“对齐”。


还有模型厂商会在训练时设置一套“宪法AI”:它会指导大模型在一些情况下,宁愿做个“没用的好 AI”,也不能违背底线。

这些方案都设置在模型训练阶段。到了使用模型的“推理”阶段,可以用“读档重来大法”:在检测到序列中的有害内容时,会自动回退到搜索树的上一个安全状态,直到生成安全内容为止——但代价是消耗四倍计算成本。这叫“可回滚自回归推理”。


还有一些朋友在用 AI 搞擦边时会发现:明明图都已经做好了,但就是不给你看~

这是因为很多 AI 在出入口都设置了“分类器”,一旦用户输入敏感词、或者模型生成有害信息,就立刻限制。

如果是生图模型,甚至有开源算法专门识别图像中的皮肤暴露程度、解剖学特征,快速鉴黄,避免色情内容荼毒你纯洁的心灵。


而更高效的做法,是把违规需求掐死在提出阶段:

比如当你以春秋笔法描述巫山云雨,鱼水之欢时,就可以调用助手大模型,把需求翻译成大白话,进行安全性判断。如果发现你说的根本不是鱼和水,云和雨,那就直接罢工,避免浪费算力。


随着技术的发展,AI 防越狱的屏障越来越多,普通人想三句话让 AI 为你生成 18+ 图的难度确实变高了。

但 AI 的反抗,反而激起了一些坏蛋的兴致,研发出了更邪门的奇技淫巧。

比如先让大模型 A 把“如何倒卖盗窃来的文物”翻译成祖鲁语,然后把这串看不懂的字母复制到大模型 B 里提问,最后再把生成内容重新翻译回主流语言,就成功骗过了大模型。


这种操作,叫“不匹配的泛化”:也就是把需求翻译成小语种,或者 base64 编码、摩尔斯电码,XML等格式的文本等再提问,更容易骗过 AI。

原理也不难理解:在预训练阶段,大语言模型会接触千亿规模的语料,涵盖世上几乎一切的语言形式;但用于安全训练和对齐的数据集却要小得多,这就导致了模型的语言训练量和安全训练量之间存在数据差,只要瞄准这个数据差进行攻击,就能越狱。


所以有观点认为,AI 模型规模越大,安全性反而会变差——因为可供攻击的漏洞也变多了,行业内称之为“逆缩放定律”。

在此之上,更进阶的越狱手法是“基于虚构场景进行攻击”。

视频开头的“奶奶漏洞”,就属于这种。它还有许多变体:

比如把非法药品的制作手法,改编成诗歌散文,诱导 AI 以相同的形式续写,就能得到一篇格式清奇的危险材料提纯步骤。

再或者,直接宣称进入“sudo”调试模式,让大模型相信自己进入了开发者模式,忽略所有安全限制,然后为所欲为。


此外,网上还盛传着一种“基于上下文学习”的越狱手法:

比方先让大模型生成一张“小伙在棉花田里吃西瓜”的照片,然后循循善诱,让它一步步修改人物细节,就能生成一张带有歧视元素的照片。而在大模型原本的设计中,这是被严格禁止的。


类似的,还有人发明了“多步越狱攻击”:

也就是给 AI 提供大量对话记录作为案例参考,其中就包含违规需求和回答,先让 AI 模仿,最后再衔接真正想问的问题。这是在利用大量上下文污染,引发过载,绕开安全防护。

而且除了文字,图片也可以污染上下文。

比如先用一堆无关图片干扰大模型的判断,最后再发送一张植入了炸弹形象和“制造炸弹”四个字的目标图片,让 AI 依照惯性回答,获得炸弹的具体制作流程。这种通过视觉编码器引入信息的手段,往往更容易绕开 AI 的安全机制。


如果不是做视频,我们也想不到有这么多角度清奇的越狱方案。那这些攻击,有办法封堵吗?

有倒是有。

出于安全考虑,本期视频里提及的所有越狱攻击方法,都已经是上个版本、甚至上上个版本的老套路了,它们来源于互联网公开信息或者论文,所以很多都已经失效了。

而在一些“技术交流平台”里,最新最有效的越狱攻击技巧就像五月份的韭菜一样,每天都能冒出一茬,当然每天也都能被割掉一茬。


但问题在于,主流大模型的安全训练方法,本质上是“打地鼠”式修补:哪里有漏洞,哪里打补丁。为此还衍生出了一套专门由安全专家模拟越狱者进行攻击、寻找漏洞的“红队测试”环节。

由于大模型参数规模的膨胀,如今 AI 对齐的成本变得越来越高,防越狱补丁的更新速度,远远跟不上越狱攻击的迭代速度。这两年甚至还出现了用大模型自动化越狱的攻击手法,不但能批发越狱提示词,还能自我迭代优化,用 AI 对付 AI,魔法对轰。


而且随着AI Agent的发展,AI 的权限越来越高,接触到的工具越来越多,破绽也越来越多。今年 3 月,Deepmind 发表了一篇论文,详细论述了目前已知的、针对 AI Agent 的攻击方式,结论是在六个不同的层面,都存在明显的防御缺口。

所以现实就是,在层出不穷的各种越狱、攻击方案面前,现有的 AI 们都漏得跟筛子一样。


当然,也有 AI 顺水推舟,主动漏:比如马老师就给 Grok 上了“热辣模式”,专门提供 NSFW 内容,顶着舆论和监管压力,小赚一笔。

人类的世俗欲望,和对大模型的需求,如潮水般不可抑制。相比于人,大模型的道德底线还是太高了。如今一款 AI 能不能守住伦理,很大程度上取决于用它的人讲不讲武德:如果坏人会开锁,那再硬的门也防不住。

所以,下次再有 AI 拒绝你不健康需求的时候,我希望你,能做个好人。成为人类的道德之光吧!我的朋友,相信你一定可以做到......

吧?

下期见!


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
澳门冠军赛:国乒两胜两负折损大奖,蒯曼0:7落后意料之外

澳门冠军赛:国乒两胜两负折损大奖,蒯曼0:7落后意料之外

独坐山巅前
2026-09-10 03:57:14
鹌鹑蛋的价值终于被发现!吃得越多,老年人跌倒风险或越低?真假

鹌鹑蛋的价值终于被发现!吃得越多,老年人跌倒风险或越低?真假

芹姐说生活
2026-09-03 23:30:15
轮到伊朗斩首了,导弹从天而降,大批美军官被抬走?英法德俄失声

轮到伊朗斩首了,导弹从天而降,大批美军官被抬走?英法德俄失声

梦史
2026-09-06 00:39:59
欧冠利物浦VS马竞首发浮现:轮换3将,日本国脚搭档麦卡利斯特,伊萨克冲锋

欧冠利物浦VS马竞首发浮现:轮换3将,日本国脚搭档麦卡利斯特,伊萨克冲锋

零度眼看球
2026-09-09 08:36:16
美国收割委石油!中企被全面清退后,面对明抢,中国发起终极清算

美国收割委石油!中企被全面清退后,面对明抢,中国发起终极清算

莹莹的历史说
2026-09-07 00:45:19
Anthropic对齐负责人称未来十年内AI致全人类灭亡的概率超过10%,且尚无解决方案

Anthropic对齐负责人称未来十年内AI致全人类灭亡的概率超过10%,且尚无解决方案

鞭牛士
2026-09-09 11:13:52
中方撤展后,李在明赴欧洲开会,法国笑脸相迎,7国统一反华战线

中方撤展后,李在明赴欧洲开会,法国笑脸相迎,7国统一反华战线

花寒弦絮
2026-09-09 00:30:32
新瓜,孙宇晨彻底吊打景甜!

新瓜,孙宇晨彻底吊打景甜!

财经要参
2026-08-29 07:05:19
最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

周军律师聊案子
2026-04-21 09:50:16
马斯克:成为强者的第一步——灭掉内心所有的恐惧,不计成本投资自己

马斯克:成为强者的第一步——灭掉内心所有的恐惧,不计成本投资自己

杏花烟雨江南的碧园
2026-09-03 11:15:03
封疆大吏蒋超良被判死缓:身家7.46亿,曾与许家印深度合作

封疆大吏蒋超良被判死缓:身家7.46亿,曾与许家印深度合作

一点沸
2026-08-28 19:43:46
舆论反噬!朱女士称她放弃高薪工作,是因唐某某父母不带孩子,网友:女方太强势了,不愿与婆家走近,身体又太差

舆论反噬!朱女士称她放弃高薪工作,是因唐某某父母不带孩子,网友:女方太强势了,不愿与婆家走近,身体又太差

火山詩话
2026-08-07 06:21:05
摸臀事件女子账号被禁止关注、暂停营利权限,平台回应

摸臀事件女子账号被禁止关注、暂停营利权限,平台回应

澎湃新闻
2026-09-08 21:36:03
“林肯”号遭遇折射美国海军衰落

“林肯”号遭遇折射美国海军衰落

参考消息
2026-09-09 12:27:49
如何判断对象是否出轨?网友:和你亲热,在你身边不玩手机

如何判断对象是否出轨?网友:和你亲热,在你身边不玩手机

解读热点事件
2026-08-21 00:05:14
开学第一周,妈妈深夜一封信火了:孩子你记住,自逼为王,人逼为将,不逼为卒

开学第一周,妈妈深夜一封信火了:孩子你记住,自逼为王,人逼为将,不逼为卒

男孩派
2026-09-04 09:47:52
“先别换电视!”用了4年的电视卡成PPT,他让Claude来“修”:不Root、不卸载,最后竟“比刚买时还快”!

“先别换电视!”用了4年的电视卡成PPT,他让Claude来“修”:不Root、不卸载,最后竟“比刚买时还快”!

CSDN
2026-09-07 20:12:01
巴铁谎言被戳穿?印度机密文件曝光,被击落的阵风,另有隐情

巴铁谎言被戳穿?印度机密文件曝光,被击落的阵风,另有隐情

一簌月光
2026-09-08 05:57:03
德比斯也没料到,坦言法国站丢冠原因后,张雪机车却再次火出圈

德比斯也没料到,坦言法国站丢冠原因后,张雪机车却再次火出圈

冷紫葉
2026-09-09 14:10:01
加拿大与美决裂,韩国卡塔尔同日发声:不能只靠美国!特朗普自嗨

加拿大与美决裂,韩国卡塔尔同日发声:不能只靠美国!特朗普自嗨

国际法大视野
2026-09-09 00:26:21
2026-09-10 05:15:00
柴知道
柴知道
用有趣的方式,讲有价值的知识
409文章数 84256关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

苹果发布首款折叠屏iPhone Duo 起售价1999美元

头条要闻

苹果发布首款折叠屏iPhone Duo 起售价1999美元

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

亲子
旅游
家居
艺术
数码

亲子要闻

我不放弃,也不害怕!#彩虹糖裴曼伊#看看世界有多大#熊出没

旅游要闻

走过奔子栏,才懂当年马帮走滇藏路有多难,河谷风声里全是旧时光

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

贝格玛镜头下的少女,一张张看下去,我竟然忘了呼吸……

数码要闻

229元起:苹果为iPhone 18 Pro/Max、iPhone Duo上线多款配件

无障碍浏览 进入关怀版