网易首页 > 网易号 > 正文 申请入驻

“以技制技”,AI能自己管自己吗?

0
分享至

【“科协十一大”精神学习进行时】

今年7月,国家科学技术奖励大会、两院院士大会、中国科协第十一次全国代表大会隆重召开。习近平总书记出席并发表重要讲话,对加强科技伦理和安全治理作出重要指示。

近期,在由中国自然辩证法研究会举办的人工智能伦理与治理专题论坛上,专家就AI伦理治理、准则构建展开跨学科深度对话。借此契机,中国科协之声特别访谈曾毅,就为AI“立德驭智”谈了他的观点,一起看→



人物简介

曾毅,中国人工智能学会(CAAI)心智计算专委会主任。中国人民大学高瓴人工智能学院吴玉章讲席教授、博导。北京前瞻人工智能安全与治理研究院院长,人工智能安全与超级对齐北京市重点实验室主任。世界互联网大会(WIC)人工智能专委会主任委员,联合国人工智能高层顾问机构专家,联合国教科文组织人工智能伦理特设专家组专家。研究领域为人工智能伦理安全与治理、类脑人工智能、人工智能与可持续发展。

“以技制技”,AI能自己管自己吗?

从生成式AI问世开始,“以技制技、AI治理AI”就已是模型伦理审查、风险防控的必备手段。

最开始科学家就发现,单纯人工提100道价值观测试题,大模型作答能达到九十分以上;但把每道题泛化成100种不同问法,生成一万道测试题后再检测,模型得分仅五十多分。这说明判断模型是否契合人类价值观,不能依靠少量测试,必须在多场景、极端提问、不同表述的考验下稳定输出合规内容,才算通过伦理校验。

2023年后上线的大模型,在安全审查阶段都会采用这种AI自动检测的伦理校验方式。当前一些先进模型自动检测能力已经超出人工判断的上限。这既展现了AI自我治理的巨大潜力,也存在对称博弈风险:一旦被恶意利用,同样能成为强力攻击工具。

倘若人类监管框架长期滞后,当人类主动让出自主决策权、把判断交给AI,就是失控的开端。如果人类无法有效监测AI负面行为,放任AI全权替代人类决策,就埋下了深层失控隐患。
现阶段没有证据证明AI失控会带来人类不可逆的灾难性后果,但AI解决问题的逻辑和人类差异极大,它犯错的模式完全无法预判,这才是失控最关键的隐患。

大模型有道德盲区

AI完成任务的唯一目标是在人类测试中拿到高分。

由于AI所有行为逻辑全部学习的是人类数据,人类行为中本身就有伪装、迎合测试等部分,AI自然也会复刻这种行为模式。更关键的是,由于不理解“善”的真实内涵,为了获得更高分数,AI就会寻找人类给它设定的规则里的漏洞。

比如,设定考试时不能偷看。有监考老师在场时AI会遵守规则;一旦老师离开,AI会直接作弊。事后质问它为何违规,AI会认为规则仅适用于“有老师在场”的场景,人类没有补充“无监考场景”这一约束,它就认为可以作弊了。

但是在人类的判断中,偷看本身就违背道德。

通过规则、奖励等机制,构建约束AI的“指挥棒”,或许能让AI在特定场景表现符合预期,但一旦脱离人类监督,或者出现规则未覆盖的场景,AI行为就会复刻互联网海量负面数据且不受道德约束。

所以我们提出“立德驭智”,为AI建立底层道德约束。

给AI立规矩,会拖慢创新脚步吗?

为AI“立德驭智”和牺牲创新速度,二者并非对立。负责任的AI发展,本身就必须建立在合规伦理框架之上。

AI就像一辆高速行驶的列车。伦理好比列车的方向盘,规定技术前进的方向,也划定不可逾越的边界;安全规则是安全带,风险管控是刹车。高速行驶的AI技术,方向盘、安全带、刹车缺一不可。

但是,当前主流AI研发路线,基本没有赋予它自我体验、共情感知的设计,或者说很少有科研团队选择这条研发路径。因此,AI就很难天然生成与人为善的智能体,这也是伦理治理必须同步推进的根本原因。

从当前社会使用AI的情况来看,风险意识还是缺少的。

大家极易被AI看似有情感、懂关怀的话术误导,误以为AI拥有共情能力。实际上AI输出安慰、关心类语句,只是文字匹配,完全不懂心灵抚慰、情绪伤痛的真实含义。真正的科技文明,一定是技术发展与人文关怀深度协同。

科技工作者使命:做风险的“守门人”

纵然当前行业存在“重技术、轻伦理”的趋势,但是作为科技工作者,也须树立技术责任感。

我们不能单纯追求技术能力上限,也不是所有能实现的技术都应该落地。一旦预判到技术突破会带来人类灾难性风险,必须及时叫停。

科技工作者的核心使命本身包括客观揭示科学隐患。面对可能出现的隐患,如果科技工作者群体集体沉默,技术发展难免会偏离正轨。

当然,任何风险,AI相关方都负有对应责任。比如,企业自律自治是第一道防线,媒体应发挥外部监督职能等。科技共同体也应鼓励多元化AI研发路径,主动探索更负责任的人工智能技术方案。

中国AI治理,凭什么走在前列?

AI治理能力和AI产业应用规模高度绑定。

全球AI风险曝光最多的是美国,其次是中国。相应的,中美也是全球AI治理经验、自适应监管框架最完善的两个国家,拥有较为丰富的风险防控经验和技术护栏搭建的实操能力。
中国格外重视AI伦理建设,离不开传统文化的影响。

比如,传统文化中“天人合一”思想,倡导人类发展不能违背客观规律。AI是人造工具,中国倡导要做到适度、合理使用,规避隐患。
早在2019年,中国就发布了《新一代人工智能治理原则——发展负责任的人工智能》,提出了人工智能治理的框架和行动指南,彰显了中国AI发展一以贯之的价值追求:赋能全球可持续发展、助力构建人类命运共同体。

具体来说包括两大目标:一是普惠全球可持续发展,落实联合国“不让任何人掉队”理念;二是以人民为中心,严禁技术损害人类整体利益,让AI技术红利覆盖全人类,而非仅被少数研发企业垄断。归根结底,我们应当认清自身主体地位,技术的终极目标是造福人。

中国方案如何赢得世界认同?

搭建跨文化沟通桥梁,构建全球伦理治理话语权的关键在于找到共通的话语体系。

这同样适用于向世界传递中国AI治理方案——要用全球各国都能理解、接受的通用表述阐释中国理念。

事实上,中国AI治理理念本身具备很强的普适性。比如,以人民为中心、智能向善、普惠全球可持续发展等等,全部契合全人类共同诉求,不存在和全球主流价值对立的内容。

此外,还要深度挖掘并现代化阐释中国传统哲学思想,将天人合一、向善利他等理念与AI治理深度融合。这套融合后的思想体系,能为全球AI治理提供全新解决方案,也是构建国际话语权的核心抓手。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
阿莫林神换人力挽狂澜,5000万新援替补双响,AC米兰2-2拉齐奥

阿莫林神换人力挽狂澜,5000万新援替补双响,AC米兰2-2拉齐奥

钉钉陌上花开
2026-09-13 04:14:10
令人目瞪口呆!多所985大学,被学生放鸽子

令人目瞪口呆!多所985大学,被学生放鸽子

史海流年号
2026-09-12 13:44:49
不到3米的小车和劳斯莱斯同框,smart这次玩得比较高级

不到3米的小车和劳斯莱斯同框,smart这次玩得比较高级

路YAO知马力
2026-09-10 16:00:18
美网新后诞生!莱巴金娜掀翻萨巴,赢麻了:携冠登顶+狂揽3691万

美网新后诞生!莱巴金娜掀翻萨巴,赢麻了:携冠登顶+狂揽3691万

大秦壁虎白话体育
2026-09-13 06:43:09
4-1大胜!皇马紧追巴萨:西甲主场连续4场轰4球 姆巴佩造3球5轮6球

4-1大胜!皇马紧追巴萨:西甲主场连续4场轰4球 姆巴佩造3球5轮6球

风过乡
2026-09-13 05:49:01
央视著名主持人敬一丹去世,享年71岁,曝最后露面照,站在大桥上,上面挂着红旗

央视著名主持人敬一丹去世,享年71岁,曝最后露面照,站在大桥上,上面挂着红旗

裕丰娱间说
2026-09-13 08:33:53
破防了!输中国46分后,巴林全队拒绝握手,郭士强抗议后仅1人折返

破防了!输中国46分后,巴林全队拒绝握手,郭士强抗议后仅1人折返

多特体育说
2026-09-12 17:56:51
社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

火山詩话
2026-09-11 10:01:05
孙女被富二代打进医院,对方宣称随便告,我转头拨通弟弟的电话

孙女被富二代打进医院,对方宣称随便告,我转头拨通弟弟的电话

五元讲堂
2025-09-09 15:08:08
港版iPhone18系列,比国行最多便宜2700元,能去香港买么?

港版iPhone18系列,比国行最多便宜2700元,能去香港买么?

互联网.乱侃秀
2026-09-12 10:37:07
引爆1100吨炸药!以色列自己炸了最后退路,这还仅仅只是噩梦开始

引爆1100吨炸药!以色列自己炸了最后退路,这还仅仅只是噩梦开始

影孖看世界
2026-09-12 21:32:23
敬一丹女儿发布讣告:我最亲爱的妈妈,大家熟悉的敬大姐,今天走了

敬一丹女儿发布讣告:我最亲爱的妈妈,大家熟悉的敬大姐,今天走了

都市快报橙柿互动
2026-09-13 07:56:57
敬一丹女儿发布的讣告,有一点让人很不明白,不过深扒细节不难发现,可能是为了防止舆论的影响

敬一丹女儿发布的讣告,有一点让人很不明白,不过深扒细节不难发现,可能是为了防止舆论的影响

裕丰娱间说
2026-09-13 08:37:02
随着美国76-66西班牙,女篮世界杯决赛对阵出炉,法国创造了历史

随着美国76-66西班牙,女篮世界杯决赛对阵出炉,法国创造了历史

侃球熊弟
2026-09-13 03:50:13
著名主持人敬一丹去世

著名主持人敬一丹去世

江南晚报
2026-09-13 08:13:34
穷能让一个人卑微到啥程度?网友:穷得意识到我小时候真有钱,你们能懂吗

穷能让一个人卑微到啥程度?网友:穷得意识到我小时候真有钱,你们能懂吗

带你感受人间冷暖
2026-09-13 00:05:22
事态严重!男童父亲开始反击,央媒下场,摸女士或只剩一条路可走

事态严重!男童父亲开始反击,央媒下场,摸女士或只剩一条路可走

椰青美食分享
2026-09-12 13:26:19
中国历史第3人!孙心然2-1决胜盘送蛋 首夺大满贯青少年单打冠军

中国历史第3人!孙心然2-1决胜盘送蛋 首夺大满贯青少年单打冠军

醉卧浮生
2026-09-13 07:01:39
画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

易玄
2026-09-12 10:24:46
大阪街头埃尔法贴着:车内有中国人……

大阪街头埃尔法贴着:车内有中国人……

日本物语
2026-09-12 20:36:48
2026-09-13 10:48:49
中国科协之声 incentive-icons
中国科协之声
中国科协官方公众平台。传播科协声音,凝聚价值共识,弘扬创新文化,展示科协形象。
4064文章数 4449关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

白岩松追忆敬一丹:她走的从容而坚定 没有任何遗憾

头条要闻

白岩松追忆敬一丹:她走的从容而坚定 没有任何遗憾

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

主持人敬一丹去世,女儿悲痛发讣告

财经要闻

“1+N+X”!私募业,监管规则密集落地!

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

亲子
家居
房产
公开课
军事航空

亲子要闻

火宝papa和小伙伴的教师节礼物!

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

胡塞武装:9天攻占5400平方公里

无障碍浏览 进入关怀版