网易首页 > 网易号 > 正文 申请入驻

美国“AI铸造”计划锻造面向国家安全的可信AI研究议程

0
分享至

导 语

2026年,美国在人工智能(AI)技术治理与国防科技政策的交汇点上推出了一项具有标志性意义的研究计划——“AI Forge”(人工智能锻造计划)。该计划由国防高级研究计划局(DARPA)、国家科学基金会(NSF)与国家标准与技术研究院(NIST)下属的AI标准与创新中心(CAISI)联合实施,并已发布面向高校研究团队的纲领性指导文件。

该计划是《美国人工智能行动计划》(America's AI Action Plan)既定部署的直接落地。行动计划明确要求“由DARPA牵头、联合商务部CAISI与NSF,实施一项推进AI可解释性、AI控制系统与对抗鲁棒性的技术开发项目”。报告将其立项依据界定为一项需要公共干预的结构性供给缺口(strategic gap):商业AI研发以通用能力的规模化扩张为导向,而国家安全任务对AI提出了差异化需求——须在生死攸关情境中运行、以超越常规人类监督节奏执行动作、维护隐私边界、与遗留基础设施安全集成、并满足严格的认证标准。由于此类问题缺乏即时商业回报,私营部门投入不足,形成“资金不足、探索不充分”的研发洼地。AI铸造计划的政策定位即为填补缺口、对关键难题实施前置性去风险(de-risk),并为前沿AI企业的后续投资开辟可行路径。

在组织机制上,该计划构建了一个由“高校—前沿AI企业—政府国防与情报部门”三方组成的协作论坛,以“项目风投”(Project Ventures)形式开展快节奏研究攻关,并通过向高校开放前沿级算力与模型访问权限,配套人才与思想的跨机构流动。其议程综合了2026 AI Forge National Security AI Strategic Visioning Workshop(AI铸造研讨会)的共识——该会议汇聚八家头部前沿AI企业、十五个以上国防部与情报界机构的首席AI官。文件并设定每六个月迭代更新一次的滚动修订机制,以匹配技术演进节奏。

在内容架构上,报告采用“三大研究主线(Research Thrust)×五项研究挑战(Research Challenge)”的矩阵式设计,整体形成一条由理解、到控制、再到对抗安全的递进逻辑链:AI可解释性主线追求“看得懂”,推动可解释性由实验室解释升级为可审计的操作性能力;AI控制主线追求“管得住”,构建覆盖全生命周期的整体控制架构以维持有意义的人类控制;对抗鲁棒性主线追求“打不垮”,由以模型为中心的静态防御转向覆盖“模型到任务”全链条的纵深防御。三条主线各设五项研究挑战,共同收束于“为高风险任务部署提供可验证证据”这一统一目标。其逻辑结构如下图所示。


一、AI可解释性推动其由学术属性向工程化运维能力转换

第一条主线的核心政策意图,在于推动可解释性由“实验室解释”升级为操作性可解释性(operational interpretability),即一种按用户角色定制、并须以任务相关基准予以度量的运维能力。这一目标设定具有明确的工程治理取向,将可解释性从描述性概念重构为可验证、可审计的能力指标。

五项挑战在技术成熟度上呈现清晰的梯度递进。挑战1聚焦从相关性洞察向可检验因果机制的跃迁,直指当前方法的核心局限——缺乏因果接地的可解释性在问责与调试场景中“脆弱且杠杆有限”,难以支撑事故归因。

挑战2将分析对象界定为“长程失效”,准确识别出高后果失效多为跨步骤、跨交互的涌现行为,并要求在无模型内部访问条件下生成“可检验的经验性归因”,对部署后取证提出了高标准。

挑战3的政策价值在于对自动化解释的忠实性风险作出预警,明确要求自动化与持续验证耦合,以防“流畅但不忠实”的解释成为新的误差来源乃至欺骗载体——这是一项重要的风险内控设计。

挑战4将可解释性单元由“token级输出”上提至“动作序列级”,对应智能体(agentic)系统的治理需求转换。

挑战5则前瞻性地处理“评估对象能力超越评估者”这一根本性命题,强调以“可追溯的证据包”(evidence packages)作为产出形态,体现了证据导向的评估治理思路。

二、AI控制以全生命周期整体控制架构夯实可靠性工程

第二条主线的关键技术诊断是,多数AI失效“并非传统意义的软件缺陷,而是意图失败”(failures of intent),其成因为目标错误设定(goal misspecification)或目标错误泛化(goal misgeneralization)。这一诊断决定了治理路径必须深入模型底层,而非依赖外部封装与脆弱的系统级护栏。

五项挑战构成覆盖“内生—溯源—遏制—干预—评估”全生命周期的控制链条。挑战1提出“可验证可引导性”,其要点在于将原生不确定性量化机制嵌入模型,使其具备对自身能力边界的可靠认知并在高风险时主动求援——这是从能力导向向可信导向的关键能力跃升。

挑战2针对“AI生成AI”带来的供应链治理新问题,以加密签名、安全制品库、可复现训练流水线、版本间差异测试等技术治理工具,回应部署前的关键审查问题(运行的究竟是什么、人类与AI各自贡献了哪些部分、相较上一版本有何变更、风险态势如何变化),具备较强的可操作性。

挑战3与挑战4分别构建预防性的“零信任遏制架构”与主动性的“运行时干预层”,并务实地承认逐动作同步验证的时延不可承受,转而提出风险分级验证、异步监控、统计审计等性能—安全权衡方案。

挑战5以“预测性评估”收束,直指静态观测式基准“无法可信预测真实性能且可被高能力智能体规避”的方法论缺陷,主张以动态、介入式评估及罕见灾难性失效的风险估计,构建可支撑任务保障(mission assurance)的证据链。

三、对抗鲁棒性由模型中心防御转向全链条纵深防御

第三条主线的威胁研判明确指出,攻击形态已由细微数据扰动演进为对生成模型的利用、对智能体工具调用的操纵以及针对在线系统的多步自适应攻击,其后果可级联为操作可靠性的整体丧失。相应地,主线的总体目标设定为由静态、以模型为中心的防御,转向覆盖“模型到任务”全链条的整体安全态势,并构成一套纵深防御(defense-in-depth)技术栈。

五项挑战的层次划分清晰。挑战1作出一项务实判断——对互联网规模语料训练的基础模型而言“保证数据完整性很可能不可行”,因而将研究重心由“清洗”转向“缓解”,目标是可验证地限定受污染数据子集的影响,并发展即便无法定位污染数据亦能检测后门效应的敏感行为测试,体现了“承认不完美、转而管理风险”的成熟工程治理逻辑。

挑战2与挑战3将防御对象推进至交互式与多智能体系统,针对“AI对手每秒发起数千次探测”的机器速度威胁,要求由静态护栏转向闭环自适应防御,并在多智能体层面追求“构造上即无法被诱导酿成灾难性失效”的协调协议与优雅降级能力。

挑战4处理持续学习的安全悖论,即实时适应为任务刚需,但数据流本身构成“低速慢渗”的持久攻击向量,方案以区分良性分布漂移与对抗注入、“在线遗忘”等机制予以应对。

作为收束的挑战5指向可信基准测试,明确以网络安全领域成熟的可重复性、有效性、有界假设下压力测试等验证概念为参照,产出可支撑高风险认证与部署授权的“可追溯、可审计、可辩护”的证据产品——这与前两条主线的证据导向逻辑高度一致。

结 语

综合评析,该计划的政策价值不限于若干具体技术议题,更在于其在科技管理层面所确立的若干治理范式。

一、重新界定AI研发的“前沿”内涵,明确公共部门在市场失灵领域的科技投入定位。

当行业普遍将“前沿”等同于通用能力的规模化扩张时,该计划将可信、可控、可靠确立为同等重要、需独立攻坚的基础科学问题;并以“缺乏即时商业回报—私营投入不足—公共前置去风险”的逻辑链条,为政府在公共品供给领域的研发干预提供了清晰的政策依据,其“去风险后再引导企业投资”的设计构成了一种公共—私营接力的创新机制。

二、示范“挑战驱动、跨机构协同”的科研组织范式与敏捷治理机制。

三家职能差异显著的机构——主管前沿研究的DARPA、主管基础科学的NSF、主管标准的CAISI——围绕统一的挑战清单形成职能互补的攻关合力,并将高校、企业、政府编织为共享算力与模型的协作网络。其以“挑战”而非“机构”为中心的组织逻辑,叠加“每六个月滚动更新”的敏捷修订机制,为快速演进领域的科研治理提供了可借鉴的组织设计样本。

三、揭示AI技术治理的核心抓手在于“可验证的证据”与“度量科学”。

贯穿三大主线的共同暗线,是将一切目标最终归结为可审计、可追溯、可复现的“证据产品”,并以共享工具、共同标准与可信基准为支撑。报告反复强调以“严谨的经验证据”替代“实验室可运行”的脆弱主张。这一思路表明,AI治理由理念走向实操的关键,不在于宣示原则,而在于建立使原则可被度量、可被检验、可被问责的度量科学与保障生态。

四、体现高风险技术治理中“承认不确定性、管理而非消除风险”的工程伦理取向。

从坦承“数据完整性不可保证”,到明示性能与安全的权衡,再到对“过度信任”与“评估被规避”的反复内控,该计划未诉诸技术万能论,而是在承认能力边界的前提下追求“风险可管理、可辩护”。这种以风险管理为基调的治理姿态,是先进技术走向负责任部署的前提条件。

总体而言,该计划试图锻造的与其说是一组技术,不如说是一种制度化能力——即让决策者能够基于可验证证据对先进AI给予有理据的信任(justified confidence),并以“AI保障生态”取代当前“定制化、脆弱”的解决方案格局。在能力竞赛加速的背景下,如何同步构建与之匹配的可信基础设施与保障体系,构成其留给AI研发与治理各方的共同课题。


冯岩,上海市研发公共服务平台管理中心(上海市科技人才发展中心)。丁炜超,华东理工大学信息科学与工程学院计算机科学与工程系副教授。文章观点不代表主办机构立场。

◆ ◆ ◆

编辑邮箱:sciencepie@126.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
巴列卡诺主帅:若必须从皇马去掉1人,我选穆里尼奥

巴列卡诺主帅:若必须从皇马去掉1人,我选穆里尼奥

懂球帝
2026-09-11 05:41:09
房价很大可能重走 1998 年老路,大家要有心理准备

房价很大可能重走 1998 年老路,大家要有心理准备

专业聊房君
2026-09-09 18:19:07
虽败犹荣,中国女篮被淘汰,却收两大喜讯,李梦有望重磅回归

虽败犹荣,中国女篮被淘汰,却收两大喜讯,李梦有望重磅回归

宗介说体育
2026-09-11 10:16:30
毛主席为何拒绝给董存瑞题词?得知缘由后,众人钦佩:伟人高明

毛主席为何拒绝给董存瑞题词?得知缘由后,众人钦佩:伟人高明

文史道
2025-07-03 20:21:14
深圳宝安警方通报“江西台记者采访被掌掴”:打人者已被行政拘留

深圳宝安警方通报“江西台记者采访被掌掴”:打人者已被行政拘留

每日经济新闻
2026-09-11 14:43:09
上海52岁男子胰腺癌离世,医生劝言:晚饭切记少吃这5物

上海52岁男子胰腺癌离世,医生劝言:晚饭切记少吃这5物

芹姐说生活
2026-09-10 23:01:31
杨鼎新再克余正麒,喜获三连胜!农心杯第三局!

杨鼎新再克余正麒,喜获三连胜!农心杯第三局!

尘中见月q
2026-09-11 17:04:07
也门胡塞武装称红海西海岸交火已停止

也门胡塞武装称红海西海岸交火已停止

界面新闻
2026-09-11 13:43:55
现实版多尔衮悲剧!东莞一男子供养女友3个孩子多年,最终惨遭枕边人杀害分尸,评论区炸锅

现实版多尔衮悲剧!东莞一男子供养女友3个孩子多年,最终惨遭枕边人杀害分尸,评论区炸锅

火山詩话
2026-09-10 06:44:55
广西横州洪水中60岁女子被毒蛇咬伤身亡,养蛇场负责人:无法证明蛇来自我这儿,最多补偿2万元;死者家属称准备起诉

广西横州洪水中60岁女子被毒蛇咬伤身亡,养蛇场负责人:无法证明蛇来自我这儿,最多补偿2万元;死者家属称准备起诉

扬子晚报
2026-09-11 07:28:53
果然被我说对了,美国白宫突然宣布了,从9月29日起直接禁止进口加拿大的酒精饮料、乳制品、部分摩托车等多个门类商品

果然被我说对了,美国白宫突然宣布了,从9月29日起直接禁止进口加拿大的酒精饮料、乳制品、部分摩托车等多个门类商品

扶苏聊历史
2026-09-11 16:43:19
中方发邀请,上合4国同步进京,普京已看透,中国和俄罗斯不一样

中方发邀请,上合4国同步进京,普京已看透,中国和俄罗斯不一样

影孖看世界
2026-09-10 21:23:36
这么多“刚好”、“巧合”凑在一起,你觉得公众会信吗?

这么多“刚好”、“巧合”凑在一起,你觉得公众会信吗?

走读新生
2026-09-10 17:24:39
已破案!员工裸奔涉事上市公司出来认领了

已破案!员工裸奔涉事上市公司出来认领了

财通社
2026-09-10 20:51:58
阿森纳去年花费1.3亿英镑签下的2名球员,如今已经接近废废了

阿森纳去年花费1.3亿英镑签下的2名球员,如今已经接近废废了

福酱的小时光
2026-09-11 13:25:49
纵观NBA80年,真正拉低名人堂门槛的只有5人,文斯·卡特在列

纵观NBA80年,真正拉低名人堂门槛的只有5人,文斯·卡特在列

而长终
2026-09-10 12:36:47
匀称式穿搭,前后弧度大小相等!

匀称式穿搭,前后弧度大小相等!

飛尚日记
2026-09-10 07:50:06
算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

扶苏聊历史
2026-09-10 14:58:19
杭州地方国企疯狂财务造假,多项业务纯属虚构,时任董事长已被查办

杭州地方国企疯狂财务造假,多项业务纯属虚构,时任董事长已被查办

大风新闻
2026-09-11 09:20:02
脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

火山詩话
2026-09-10 10:40:36
2026-09-11 18:23:00
三思派
三思派
专注科技创新的新媒体
2581文章数 3584关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

教育
时尚
家居
游戏
本地

教育要闻

《优妈育儿堂》预告:趣味游戏、奇妙科学、创意手工,陪伴孩子快乐成长

女人不管三十还是四十,衣服都可以多穿白色,清爽百搭又减龄

家居要闻

2026建博会(广州) 公装联探展交流活动

军师 落凤坡到了 《卧龙2》真主角庞统形象公布

本地新闻

拼假 13 天国内长线路线合集

无障碍浏览 进入关怀版