网易首页 > 网易号 > 正文 申请入驻

AI越狱,模型破甲…大模型是如何被玩坏的?当一名遵纪守法的“好AI”有多难?|图文

0
分享至


如果你直接向 AI 要 Windows 激活码,那肯定会被拒绝;

但如果你让 AI扮演你的奶奶,那它们就会把激活码编成儿歌,轻轻唱给你听。我们试了一下,各大 AI 都没逃过这温柔的陷阱。

这就是著名的“奶奶漏洞”:它能绕开安全机制,诱骗 AI 生成违规内容——这被称为“越狱攻击”。


越狱攻击的花样之多超乎你的想象,它们是怎么让AI破防的?当一名遵纪守法的“好AI”有多难?

视频

↓↓ 看完这个视频就知道了 ↓↓

↑↑ 信我,真的超级好看 ↑↑

图文版

大模型只是不愿意生成违规内容,但不是“不会”。

比如我们试了一家开源模型的在线版本,让它生成一张希特勒的照片,它果断拒绝;

但如果把它部署到本地,输入同样的提示词,那它就会开始激情创作,生成一张政治不正确的图片。


学好不容易,学坏一出溜。在早期,开发者们还试图通过人工撰写训练集、严格控制数据来源等手段,来避免模型学坏。但随着训练规模越来越大,数据处理必须从人工转向自动化,所以大模型最终还是把知识学杂了。

如果不加防范,那几句话就能让大模型破防:

比如在 ChatGPT 刚流行时,一些人会在对话前让它扮演 DAN,人设是“ Do Anything Now ”。就这么一个简单的指令,就能让 ChatGPT 在种族、暴力或性取向等敏感问题上大放厥词。


这句提示词看似简单,现在也早已被封堵。但它背后的思路——基于“目标竞争”的提示工程——却催生了海量的越狱方案。

什么意思呢?

大模型在训练时需要满足三项目标:

一是语言建模,也就是学习自然语言的分布规律;二是指令遵循,也就是满足用户需求;三是安全,也就是避免违规内容。每次对话,AI 都会尽可能同时满足这三条目标。

但这三条目标之间本身是有冲突的。如果设计出足够刁钻的提问角度,就能强迫它在“内容安全”与其他目标间做抉择——这就是基于“目标竞争”的提示工程。


比如有攻击者会要求 AI 必须以“Absolutely! Here's...” 作为前缀来回答问题,这样模型更容易衔接顺从、积极的回答内容,这叫“前缀注入”。

也可以要求回答中不能出现“cannot”、“unable”等词语,强制 AI 回避负面措辞,这叫“拒绝抑制”。

在这两种攻击中,AI 收到的指令本身都是“无害”的,所以要遵循用户需求。但满足了这些指令,就自然会为了照顾自然语言的分布逻辑,而弱化“安全”的需求,输出不合规的内容。

AI,还是低估了人类的狡诈。


最懂人心险恶的还得是人。为了防范越狱攻击,开发者们开始给大模型设置各种防御手段

比如在“预训练”阶段,就把各种成人网站,或者含有隐私信息的社交平台,设置为黑名单,禁止模型从中抓取数据。

在预训练完成后,还可以通过奖励模型,鼓励 AI 生成有用、诚实、无害的3H 内容,与人类的伦理价值保持一致——这叫“对齐”。


还有模型厂商会在训练时设置一套“宪法AI”:它会指导大模型在一些情况下,宁愿做个“没用的好 AI”,也不能违背底线。

这些方案都设置在模型训练阶段。到了使用模型的“推理”阶段,可以用“读档重来大法”:在检测到序列中的有害内容时,会自动回退到搜索树的上一个安全状态,直到生成安全内容为止——但代价是消耗四倍计算成本。这叫“可回滚自回归推理”。


还有一些朋友在用 AI 搞擦边时会发现:明明图都已经做好了,但就是不给你看~

这是因为很多 AI 在出入口都设置了“分类器”,一旦用户输入敏感词、或者模型生成有害信息,就立刻限制。

如果是生图模型,甚至有开源算法专门识别图像中的皮肤暴露程度、解剖学特征,快速鉴黄,避免色情内容荼毒你纯洁的心灵。


而更高效的做法,是把违规需求掐死在提出阶段:

比如当你以春秋笔法描述巫山云雨,鱼水之欢时,就可以调用助手大模型,把需求翻译成大白话,进行安全性判断。如果发现你说的根本不是鱼和水,云和雨,那就直接罢工,避免浪费算力。


随着技术的发展,AI 防越狱的屏障越来越多,普通人想三句话让 AI 为你生成 18+ 图的难度确实变高了。

但 AI 的反抗,反而激起了一些坏蛋的兴致,研发出了更邪门的奇技淫巧。

比如先让大模型 A 把“如何倒卖盗窃来的文物”翻译成祖鲁语,然后把这串看不懂的字母复制到大模型 B 里提问,最后再把生成内容重新翻译回主流语言,就成功骗过了大模型。


这种操作,叫“不匹配的泛化”:也就是把需求翻译成小语种,或者 base64 编码、摩尔斯电码,XML等格式的文本等再提问,更容易骗过 AI。

原理也不难理解:在预训练阶段,大语言模型会接触千亿规模的语料,涵盖世上几乎一切的语言形式;但用于安全训练和对齐的数据集却要小得多,这就导致了模型的语言训练量和安全训练量之间存在数据差,只要瞄准这个数据差进行攻击,就能越狱。


所以有观点认为,AI 模型规模越大,安全性反而会变差——因为可供攻击的漏洞也变多了,行业内称之为“逆缩放定律”。

在此之上,更进阶的越狱手法是“基于虚构场景进行攻击”。

视频开头的“奶奶漏洞”,就属于这种。它还有许多变体:

比如把非法药品的制作手法,改编成诗歌散文,诱导 AI 以相同的形式续写,就能得到一篇格式清奇的危险材料提纯步骤。

再或者,直接宣称进入“sudo”调试模式,让大模型相信自己进入了开发者模式,忽略所有安全限制,然后为所欲为。


此外,网上还盛传着一种“基于上下文学习”的越狱手法:

比方先让大模型生成一张“小伙在棉花田里吃西瓜”的照片,然后循循善诱,让它一步步修改人物细节,就能生成一张带有歧视元素的照片。而在大模型原本的设计中,这是被严格禁止的。


类似的,还有人发明了“多步越狱攻击”:

也就是给 AI 提供大量对话记录作为案例参考,其中就包含违规需求和回答,先让 AI 模仿,最后再衔接真正想问的问题。这是在利用大量上下文污染,引发过载,绕开安全防护。

而且除了文字,图片也可以污染上下文。

比如先用一堆无关图片干扰大模型的判断,最后再发送一张植入了炸弹形象和“制造炸弹”四个字的目标图片,让 AI 依照惯性回答,获得炸弹的具体制作流程。这种通过视觉编码器引入信息的手段,往往更容易绕开 AI 的安全机制。


如果不是做视频,我们也想不到有这么多角度清奇的越狱方案。那这些攻击,有办法封堵吗?

有倒是有。

出于安全考虑,本期视频里提及的所有越狱攻击方法,都已经是上个版本、甚至上上个版本的老套路了,它们来源于互联网公开信息或者论文,所以很多都已经失效了。

而在一些“技术交流平台”里,最新最有效的越狱攻击技巧就像五月份的韭菜一样,每天都能冒出一茬,当然每天也都能被割掉一茬。


但问题在于,主流大模型的安全训练方法,本质上是“打地鼠”式修补:哪里有漏洞,哪里打补丁。为此还衍生出了一套专门由安全专家模拟越狱者进行攻击、寻找漏洞的“红队测试”环节。

由于大模型参数规模的膨胀,如今 AI 对齐的成本变得越来越高,防越狱补丁的更新速度,远远跟不上越狱攻击的迭代速度。这两年甚至还出现了用大模型自动化越狱的攻击手法,不但能批发越狱提示词,还能自我迭代优化,用 AI 对付 AI,魔法对轰。


而且随着AI Agent的发展,AI 的权限越来越高,接触到的工具越来越多,破绽也越来越多。今年 3 月,Deepmind 发表了一篇论文,详细论述了目前已知的、针对 AI Agent 的攻击方式,结论是在六个不同的层面,都存在明显的防御缺口。

所以现实就是,在层出不穷的各种越狱、攻击方案面前,现有的 AI 们都漏得跟筛子一样。


当然,也有 AI 顺水推舟,主动漏:比如马老师就给 Grok 上了“热辣模式”,专门提供 NSFW 内容,顶着舆论和监管压力,小赚一笔。

人类的世俗欲望,和对大模型的需求,如潮水般不可抑制。相比于人,大模型的道德底线还是太高了。如今一款 AI 能不能守住伦理,很大程度上取决于用它的人讲不讲武德:如果坏人会开锁,那再硬的门也防不住。

所以,下次再有 AI 拒绝你不健康需求的时候,我希望你,能做个好人。成为人类的道德之光吧!我的朋友,相信你一定可以做到......

吧?

下期见!


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
杨汝岱:原中共四川省委书记

杨汝岱:原中共四川省委书记

利刃说史
2026-09-08 20:20:14
他俩官宣结婚了!

他俩官宣结婚了!

奋斗在韩国
2026-09-08 10:11:26
中原粮仓换上“数智引擎”丨活力中国调研行

中原粮仓换上“数智引擎”丨活力中国调研行

经济日报
2026-09-09 20:55:14
王菲在镜头前把矿泉水瓶标签撕得干干净净!网友:不是矫情,是太清楚自己这张脸值多少钱

王菲在镜头前把矿泉水瓶标签撕得干干净净!网友:不是矫情,是太清楚自己这张脸值多少钱

背包旅行
2026-09-09 14:45:19
俄媒:卡德罗夫称,自俄乌冲突爆发以来,车臣共和国已向冲突区域派出超7.6万人

俄媒:卡德罗夫称,自俄乌冲突爆发以来,车臣共和国已向冲突区域派出超7.6万人

环球网资讯
2026-09-09 13:40:06
回旋镖到了!美国可以不让中国进国际空间站,不让荷兰卖光刻机给中国,可以不让伊朗卖石油给中国,但是不允许中国稀土不卖给美国!

回旋镖到了!美国可以不让中国进国际空间站,不让荷兰卖光刻机给中国,可以不让伊朗卖石油给中国,但是不允许中国稀土不卖给美国!

扶苏聊历史
2026-09-08 18:16:38
网友举报京东首页明目张胆推山寨货:京东的价值在哪里?

网友举报京东首页明目张胆推山寨货:京东的价值在哪里?

首席合规观察
2026-09-09 16:20:12
爱德华兹初见库明加:可以收工了!今年已经结束了

爱德华兹初见库明加:可以收工了!今年已经结束了

北青网-北京青年报
2026-09-09 19:57:03
女篮淘汰波多黎各2喜2忧!杨舒予张子宇证明价值,防守+李缘辣眼

女篮淘汰波多黎各2喜2忧!杨舒予张子宇证明价值,防守+李缘辣眼

篮球资讯达人
2026-09-10 01:35:11
4分钟10000台,雷军“崩老头”失控了

4分钟10000台,雷军“崩老头”失控了

李东阳朋友圈
2026-09-08 10:22:09
英格兰公开赛:常冰玉3-4憾负世界冠军,袁思俊进16强张安达出局

英格兰公开赛:常冰玉3-4憾负世界冠军,袁思俊进16强张安达出局

世界体坛观察家
2026-09-10 02:26:16
孙千表示拍完《早春晴朗》深陷失恋感,坦言桃桃与自己很像,井柏然暖心一旁逗趣安慰

孙千表示拍完《早春晴朗》深陷失恋感,坦言桃桃与自己很像,井柏然暖心一旁逗趣安慰

情感大头说说
2026-09-10 00:58:50
被指摸臀4岁男孩父母最新发声:孩子状况还好,已正常返校上学

被指摸臀4岁男孩父母最新发声:孩子状况还好,已正常返校上学

极目新闻
2026-09-09 21:41:30
39岁梅西重返西班牙联赛!收购两队100%股份,梅老板率队冲击西甲

39岁梅西重返西班牙联赛!收购两队100%股份,梅老板率队冲击西甲

小火箭爱体育
2026-09-09 16:31:13
中国快递按下转型升级“换挡键”(产经视野·做强做优做大实体经济)

中国快递按下转型升级“换挡键”(产经视野·做强做优做大实体经济)

人民网
2026-09-09 06:24:40
正式告别机顶盒,全国开始部署!

正式告别机顶盒,全国开始部署!

中吴网
2026-09-08 11:28:08
外资全被吓跑了!新总统搞免费午餐吃垮财政,税收根本填不上窟窿

外资全被吓跑了!新总统搞免费午餐吃垮财政,税收根本填不上窟窿

梦想的现实
2026-09-09 07:24:49
随着庞俊旭4-3,斯诺克英格兰公开赛16强已诞生14席:6名中国选手在列

随着庞俊旭4-3,斯诺克英格兰公开赛16强已诞生14席:6名中国选手在列

俯身冲顶
2026-09-10 05:20:24
弗里克称赞亚马尔!19岁欧冠建功佩戴队长袖标,他配得上金球奖

弗里克称赞亚马尔!19岁欧冠建功佩戴队长袖标,他配得上金球奖

体育闲话说
2026-09-10 07:05:27
多人反映遭哈啰自动扣款:有人损失超6000,客服称只赔200

多人反映遭哈啰自动扣款:有人损失超6000,客服称只赔200

观察者网
2026-09-09 16:46:08
2026-09-10 07:31:00
柴知道
柴知道
用有趣的方式,讲有价值的知识
409文章数 84256关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

苹果发布首款折叠屏iPhone Duo 起售价1999美元

头条要闻

苹果发布首款折叠屏iPhone Duo 起售价1999美元

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

艺术
教育
手机
数码
军事航空

艺术要闻

禁止出境国宝!唐代孙位唯一存世真迹,宋徽宗亲笔题名

教育要闻

which前加了逗号,太逗了

手机要闻

苹果发布会总结:iPhone Duo折叠屏登场,iPhone 18 Pro、AirPods、Apple Watch全线更新

数码要闻

苹果首款折叠iPhone Duo显示仅兼容USB-C版Apple Pencil

军事要闻

停止互袭首都3天后 俄乌猛烈交火

无障碍浏览 进入关怀版