网易首页 > 网易号 > 正文 申请入驻

治理之智 | 以智能促安全:多模态技术演进与价值对齐

0
分享至

导语:

2025年11月,Google Gemini 3的发布凭借其代际领先的视觉与逻辑理解力,标志着生成式人工智能加速迈向全模态交互的新纪元。技术能力的爆发式增长在赋能生产力的同时,也使模型能力与内容安全之间的潜在张力,成为备受关注的公共议题。

当前,相关的社会关切主要围绕以下三个维度展开:一是价值观偏离风险,即当前存在一种常见的误解,认为“中文语料”等同于“中式价值观”,进而担忧依赖海外数据训练的模型会无意识地携带和放大偏见,甚至生成与我国主流价值观相悖的内容;二是内容治理与责任追溯难题,面对生成式AI在输入端潜在的“数据投毒”威胁以及输出端的高逼真伪造能力,公众担忧现有的监管手段难以覆盖全链条风险,且在出现违规内容时难以精准追溯责任链条,导致“法不责众”或“无从追责”的困境;三是技术演进引发的安全滞后风险,即随着模型向全模态交互演进,其技术架构的革新也对传统安全防护模式构成挑战,担忧安全机制的迭代速度跟不上技术能力的发展。面对上述挑战与关切,我们应当秉持科学、理性且务实的态度,只有在深入理解模型技术原理的基础上,并结合中国AI治理的制度思路和产业落地实践,才能有效回应社会疑虑并对解题之道形成共识。

一、对齐什么?价值观由“语义内核”而非“语种表征”决定

针对第一重社会关切,即模型是否存在“价值观偏离”的风险,其破题关键在于厘清模型价值观对齐的底层逻辑,打破“中文语料”等同于“中式价值观”的认知误区。研究和实践表明,模型的“价值观”并不取决于训练语料使用的语言种类(如中文或英文),而在于语料所承载的语义内容本身。

早在2018年,自然语言处理(NLP)领域的研究便已揭示,即便仅使用单一语言进行训练,模型也能涌现出强大的跨语言泛化能力。这一发现于2025年3月被头部模型企业 Anthropic 的研究进一步深化,其研究表明,模型在学习过程中,会将知识和规律抽象为一个共享的概念空间。例如,“小”不再是一个单词,而是一个可被识别、可被推理的“概念”。当模型面对不同语言提问(如“小的反义词是什么?”)时,它调用的核心概念是一致的,进而能用相应语言准确作答。2025年4月阿里巴巴发布的 Qwen 3 模型也印证了这一点,Qwen 3支持语言从 Qwen 2.5 的 29 种迅速扩展至 119 种,而实现这一跨越仅依赖数万条新语种的语料。这充分说明,模型真正习得的是超越语言表层的“概念本质”,而非对特定词汇或语法结构的机械记忆。

这意味着,在构建高质量语料库时,核心在于语料内容是否蕴含符合中国立场、文化传统与社会共识的价值内核。只要内核正确,模型便能在其“概念空间”中将其内化,并在所有语言交互中稳定输出一致的价值表达。因此,应对价值观偏离风险的核心策略,并非机械地排斥特定语种的数据,而是专注于构建和筛选能够代表主流价值观的高质量语义内容。


图1 Anthropic研究揭示“共享概念空间”

二、如何对齐?中国AI治理体系的设计思路与产业落地实践

面对“内容治理与责任追溯”的第二重关切,特别是针对“数据投毒”引发的源头污染风险,以及高逼真伪造内容带来的下游误导风险,中国已探索构建一套覆盖“输入—训练—输出—追溯”全链条的AI治理体系,并在产业界形成了“内生安全”与“外在护栏”双重机制并行的落地实践。

在治理制度层面,坚持“管进”与“管出”结合。从“管进”(输入/训练语料端)来看,国家标准《生成式人工智能服务安全基本要求》(GB/T 45654-2025)确立了严格的源头把控机制:既要求确保数据获取途径的合法合规,通过随机抽样安全评估并提升来源多样性,又强调在内容处理上滤除违法不良信息,严格尊重知识产权与个人信息;此外,还对人工标注的规则、人员与流程进行了规范,以防止数据加工环节引入二次风险。从“管出”(输出/生成内容端)来看,《人工智能生成合成内容标识办法》构建了完备的AI标识体系:一方面通过显式标识让生成内容“亮明身份”,防止公众混淆;另一方面通过隐式标识保障全流程可追溯,确保能精准定位违规开发者或恶意使用者。

在企业落地层面,安全机制分为“内生安全”与“外在护栏”两层防线。内生安全方面,可以通过安全指令微调(Safety Supervised Fine-Tuning, 安全SFT)和人类反馈强化学习(Safety Reinforcement Learning from Human Feedback, 安全RLHF)等成熟技术,将符合国情的价值观与意识形态规范深度内化为模型参数层面的固有认知,赋予模型在概念空间内主动识别并拒止不当请求的能力。例如,BBC等外媒曾多次测试发现,中国头部大模型在面对涉及“台湾问题”等敏感政治议题的诱导性提问时,能够始终严守“一个中国”原则或拒绝回答违规内容。针对外界担忧的“数据投毒”风险,在动辄TB级的海量训练数据面前,单点有害数据的比例极低,其影响就像一滴墨水撒进了太平洋,难以撼动整体价值观。相反,在安全微调中会有意使用少量负面样本,旨在让模型通过理解错误的具体行为与表达,获得更强的辨识与防御能力,这就像人类接种少量病毒而获得免疫力。

外在护栏方面,其核心价值在于保证时效性和因地制宜,可用于热点事件的加强防护。作为模型外挂的“即时防御系统”,通过多维度的技术组合,为交互全流程提供了灵活且可靠的安全保障:一是在输入端,对用户指令(Query)进行实时的风险识别与意图分析;二是对涉及底线的特定敏感问题,直接触发拦截机制并输出预置的合规标准回答;三是在生成环节,引入基于知识库的检索增强(RAG)技术,利用权威事实数据校准模型输出,大幅降低事实性错误与幻觉风险;四是在输出端,对模型生成的响应(Response)进行二次安全过滤,兜底拦截潜在的不良信息;五是严格落实标识要求,在内容输出时自动添加显式标识与隐式水印,确保生成内容在后续传播过程中始终可辨识、可溯源。这些外部护栏的拦截记录还会进一步转化为高质量的安全增强语料,经过清洗后回流至训练环节,补充进模型的内生安全体系,形成“防御—反馈—进化”的良性闭环。

三、新的挑战?多模态爆发驱动安全机制协同演进

针对第三重关于“安全机制滞后于技术演进”的担忧,我们应当辩证地看到,多模态技术的爆发并未单纯增加防护难度,新的技术架构反而为安全防护带来了新思路,正在推动安全机制与模型能力协同演进。当前多模态模型能力跃升的底层技术逻辑,在于将大语言模型(LLM)作为核心编码器(Encoder)引入。其核心价值是一次深刻的范式革新:即从传统的“特征提取”跃迁至“认知编码”。传统的编码器通常将输入(如文本、图像等)映射为静态的语义向量,而LLM编码器则利用在海量数据中习得的强大世界知识与推理能力,对输入进行深度的“理解与抽象”。它能够精准捕捉传统模型难以处理的复杂语境、歧义、反讽乃至隐含的逻辑关系(如因果、条件)。例如,一个经过LLM编码的向量,不仅表征了文本的“内容是什么”,更内嵌了对其“真实意图”的深度理解,从而为下游任务提供了前所未有的高质量输入。

从内容安全的角度来看,这种模式构建了多模态模型的“内生安全”能力。安全防线不再仅仅依赖外部的规则过滤或后置审查,而是内化为Encoder自身的认知本能。LLM编码器能够基于对复杂意图的理解,主动识别并标记出潜在的恶意内容,如意图隐蔽的恶意提示、指令注入攻击或隐私数据泄露风险。这是一种从“表层特征匹配”到“深层意图识别”的防御升级。

与此同时,为应对全模态交互的复杂性,“嵌入式围栏”等前沿技术路线受到关注。不同于在模型输出后进行拦截的传统模式,嵌入式围栏尝试在模型结构中植入特定参数(如LM_Head/Task Head),直接利用计算过程中富含语义信息的隐层状态(Hidden States)进行风险判别。理论上,由于中间层状态包含了比最终输出文本更丰富的语义信息与安全特征,这种方式不仅能提供更充分的判别依据,还能避免对多模态数据的反复编解码,显著降低计算成本。更重要的是,它借助基座模型强大的语义理解能力,在潜在风险内容生成之前即实现“预判”与拦截,从而达成更为前置、精准且高效的安全防护。


图2 嵌入式围栏和外挂式围栏的对比

结语

综上所述,面对大模型内容安全的新一轮挑战,我们应当认识到:智能与安全从来不是零和博弈。实践证明,模型越“聪明”,其对复杂语义的深度理解和推理能力越强,对政治、伦理风险的识别与主动规避能力也就越强,内生安全系数自然越高,进而降低对人工标注语料的依赖。这一系列产业实践有力验证了“以智能促安全,以治理促发展”的可行路径。

鉴于当前我们已拥有不断健全的监管框架、日益多元化的安全技术路线,以及行业在安全对齐方面积累的初步经验,未来的核心战略应聚焦于以下方面,以持续迭代和从根本上提升模型的内生安全水平:第一,明确对齐逻辑,确立“语义为本”的认知,持续丰富高质量、负责任的多模态语料,并通过优化训练方法,帮助模型构建正确的世界观和价值观,而非机械地排斥特定语种或领域数据。第二,深化治理实践,依托覆盖“输入—训练—输出—追溯”全链条的中国AI治理体系,实现“内生安全”与“外在护栏”的高效协同。第三,拥抱技术升级,面对全模态交互的复杂性,积极探索“嵌入式围栏”等前沿机制,将安全能力植入模型深层结构,实现风险的前置预判和精准干预,推动安全与发展的同步演进。通过政府监管、企业自律与技术升级的协同共治,我们完全有能力在充分释放AI生产力的同时,筑牢安全防线,构建一个更加智能、可信赖且安全的生成式AI生态。

作 者

徐玮 袁媛

致 谢

感谢阿里云智能集团通义安全负责人张荣为本文研究提供技术指导

版块介绍 — 治理之智

在全球化背景下,科技的快速发展也带来了前所未有的治理挑战。本板块内容依托阿里巴巴集团先进的AI科技能力、丰富的应用场景与负责任的技术生态,聚焦于AI风险、AI大模型安全、AI大模型开闭源生态、AI大模型出海等AI治理政策研究,基于技术理性的风险观,为大模型发展与安全平衡与取舍提供独到见解。同时,我们致力于收集和分享海内外AI治理先进理论与经验,为构建合理的科技治理体系提供智慧与灵感。

Reading

1、

2、

3、

4、

5、

6、

7、

8、

9、

10、

11、

12、

13、

14、

15、

16、

17、

18、

19、

20、

21、

22、

23、

24、

25、

26、

27、

28、

29、

30、

- 如需转载,请在文章下留言 -

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华为Mate 80激活量破930万台:一款卖了一年的旗舰,为什么还在爬坡

华为Mate 80激活量破930万台:一款卖了一年的旗舰,为什么还在爬坡

数码Antenna
2026-10-08 16:06:58
中共中央政治局委员、中央外办主任王毅会见太平洋岛国政治家联合考察团

中共中央政治局委员、中央外办主任王毅会见太平洋岛国政治家联合考察团

政知新媒体
2026-10-09 16:49:11
高芙:我被中国球迷网暴,我不是小偷!谁料美国网友抨击更猛烈

高芙:我被中国球迷网暴,我不是小偷!谁料美国网友抨击更猛烈

军情观察家
2026-10-08 16:22:34
美国现今才知道,中国是全世界唯一内在和外在都最强大的超级大国

美国现今才知道,中国是全世界唯一内在和外在都最强大的超级大国

一簌月光
2026-10-06 19:54:57
那个坐拥890万粉丝、体重一度逼近500斤的内蒙古网红“羊亡爷”恩克,步履虚浮难进食,暴食流量终要拿健康买单

那个坐拥890万粉丝、体重一度逼近500斤的内蒙古网红“羊亡爷”恩克,步履虚浮难进食,暴食流量终要拿健康买单

LULU生活家
2026-09-25 15:16:25
A股:上午跳水破3761拉长阴线,种种迹象表明,A股c浪调整要启动吗?

A股:上午跳水破3761拉长阴线,种种迹象表明,A股c浪调整要启动吗?

股侠指北针
2026-10-09 11:02:27
父亲将智障儿子扔青海戈壁,19年后妈妈去旅游碰见:妈妈,是你吗

父亲将智障儿子扔青海戈壁,19年后妈妈去旅游碰见:妈妈,是你吗

晓悦流年
2025-09-10 15:08:49
劝告所有子女:再孝顺,也不要为年过80岁的老父老母,做这五件事

劝告所有子女:再孝顺,也不要为年过80岁的老父老母,做这五件事

枫红染山径
2026-10-06 11:26:52
大明星赵薇的前夫,判了!

大明星赵薇的前夫,判了!

微微热评
2026-07-29 12:12:29
人伦大乱,正在毁掉中国家庭,四种乱象就在家里,别装看不见

人伦大乱,正在毁掉中国家庭,四种乱象就在家里,别装看不见

涵豆说娱
2026-10-08 01:31:06
击中两辆公交车,俄军又杀死至少33人!基辅紧急限电,冬天已提前到来

击中两辆公交车,俄军又杀死至少33人!基辅紧急限电,冬天已提前到来

鹰眼Defence
2026-10-09 16:43:44
林青霞早年和替身合影,被指不及替身长相漂亮,真的吗?

林青霞早年和替身合影,被指不及替身长相漂亮,真的吗?

木子爱娱乐大号
2026-10-08 10:37:06
饶毅急了:日本30多个诺奖,中国学术不端!

饶毅急了:日本30多个诺奖,中国学术不端!

红色少女主播
2026-10-09 00:26:23
岛内民调,蒋万安支持率暴跌,背后真相曝光,新党一人戳穿赵少康

岛内民调,蒋万安支持率暴跌,背后真相曝光,新党一人戳穿赵少康

DS北风
2026-10-08 21:18:04
陈伟俊,受贿数额特别巨大

陈伟俊,受贿数额特别巨大

政知新媒体
2026-10-09 10:09:24
“狡猾”的直肠癌!研究发现:身体若频繁出现4表现,或已是晚期

“狡猾”的直肠癌!研究发现:身体若频繁出现4表现,或已是晚期

芹姐说生活
2026-10-08 22:16:23
中国大满贯:陈幸同4-2桥本,张本美和4-2王艺迪,女单4强已出2席

中国大满贯:陈幸同4-2桥本,张本美和4-2王艺迪,女单4强已出2席

湘楚风云聊体育
2026-10-09 14:37:02
“这种环境都能排卵?”女毕业生表白单位男领导,评论区炸锅了

“这种环境都能排卵?”女毕业生表白单位男领导,评论区炸锅了

世界圈
2026-10-05 20:58:42
“收人四礼,家败人亡”:不管你多穷,这4种礼,千万别收

“收人四礼,家败人亡”:不管你多穷,这4种礼,千万别收

智慧生活笔记
2026-10-07 11:04:05
一份被嘲笑的“九宫格早餐”火了:家长假装精致,连塞牙缝都不够 ,孩子还能怎样成长?

一份被嘲笑的“九宫格早餐”火了:家长假装精致,连塞牙缝都不够 ,孩子还能怎样成长?

蝴蝶花雨话教育
2026-10-07 21:31:17
2026-10-09 17:36:49
阿里研究院 incentive-icons
阿里研究院
推动商业互联网化
1971文章数 2182关注度
往期回顾 全部

科技要闻

字节"干扰模型训练"实习生融资近2亿元

头条要闻

男子与堂嫂系情人关系分手后欲纵火同归于尽 法院判了

头条要闻

男子与堂嫂系情人关系分手后欲纵火同归于尽 法院判了

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

央行为何发布关于人民币汇率的政策立场

汽车要闻

比亚迪第三代唐内饰发布 两种风格/巨幕屏最抢眼

态度原创

教育
游戏
房产
旅游
时尚

教育要闻

解方程,逻辑清晰就简单

《高达:异轨征途》TGS游民采访:本作可玩性很高

房产要闻

中旅投资:以首发经济作答,定义人工冲浪产业的中国方案

旅游要闻

一场帐篷音乐节,如何让井研从“过境站”变成“目的地”?

从夜幕金辉到另类宇宙,巴黎更美了吗?

无障碍浏览 进入关怀版