网易首页 > 网易号 > 正文 申请入驻

至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%

0
分享至

允中 发自 凹非寺
量子位 | 公众号 QbitAI

大模型机制可解释性研究中,一直存在一个颇具反差的现实:

为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。

Transcoder、稀疏特征模块等方法会学习一组新的内部单元,用它们近似原模型某一层或某个模块的计算,再通过保留、移除这些单元来寻找任务回路。

这些方法推动了机制可解释性的发展,但也带来了一笔不小的额外成本:新的表示需要数据和优化,而且一旦替代模块没有充分复现原模块,后续分析就可能同时解释模型行为和替换误差。

说白了,研究者想打开一个黑箱,却往往需要先训练另一个“小黑箱”。

问题不只是训练成本。任务回路需要找到一组可以独立干预的内部计算:只保留它们时,相关能力仍然存在;移除它们时,模型表现则明显下降。

训练型替代表示通常还需要针对不同模型、层和checkpoint分别拟合,使大规模、系统性的回路分析更加困难。

更理想的方案应当同时保持原模型行为、提供可独立干预的单元,并能以较低成本直接从已有权重中构造。

至知创新研究院(IQuest Research)与Safe AI Forum、牛津大学、斯坦福大学、清华大学的合作者提出了一条更直接的路线:

不再训练一套独立替代网络,而是从现有的预训练权重中直接“拆”出可干预单元。

这套方法名为稀疏权重分解(Sparse Weight Decomposition,SWD)。

它把一个稠密权重矩阵分解为两个稀疏矩阵,并把二者共享的中间维度变成可独立评分、选择和消融的瓶颈单元。研究者由此可以直接在权重上抽取任务回路。

论文给出了三个值得关注的结果:

  • 在匹配替换保真度的单矩阵实验中,SWD使用的数据不到Transcoder等训练型基线的1%
  • 在GPT-2、Qwen2.5和Qwen3.5-27B的任务回路实验中,SWD通常以更少的瓶颈单元和活跃连接达到相同的充分性、必要性目标;
  • 方法不仅扩展到了27B模型,还覆盖了GPT-2 Small全部48个注意力和MLP权重矩阵,并提供了完全不需要校准文本的zero-data版本。

论文地址:https://arxiv.org/abs/2608.03913



△SWD方法概览。预训练模型中的稠密权重被分解为两个稀疏因子,共享中间坐标成为可独立评分、选择和消融的瓶颈单元。

直接把权重拆成“稀疏路径”

SWD的出发点很简单。对于预训练模型中的稠密权重矩阵W,寻找两个稀疏矩阵A和B,使得

W ≈ AB.

A和B共享m个中间维度。第i个维度先通过A的第i列从输入中读出一个标量,再通过B的第i行写向输出。这样,一列和一行共同构成一个瓶颈单元,也就是一条固定的rank-one读写路径。

可以把它想象成在一张极其密集的交通网络中增加一组“中转站”:每个中转站只连接少量入口和出口。研究者不仅可以看到一条路径从哪里读取、向哪里写入,还可以单独关闭它,观察模型行为会发生什么变化。

真正困难的地方,是如何在大幅减少连接的同时,仍然保留原权重对模型激活的作用。SWD使用少量校准文本产生的层输入,优化分解前后的输出误差;求解过程中交替更新两个因子,通过硬阈值维持非零预算,并重新拟合保留下来的权重值。分解完成后,每个瓶颈单元都可以像稀疏特征一样参与任务归因、排序和消融,但不需要再训练一套独立的神经替代网络。



△从权重分解到回路抽取。Step 1将稠密权重分解为稀疏因子A和B;Step 2按任务归因对瓶颈单元排序,并选择top-k单元组成任务回路。

已经有SVD,为什么还需要SWD?

既然目标是直接分解权重,一个自然的问题是:为什么不直接使用奇异值分解(SVD)?

SVD同样可以把一个矩阵表示为rank-one成分之和,而且不需要训练数据。近期的NaNA等方法也已经证明,SVD成分可以用于任务排序和干预。

但对回路分析而言,单元数量少,并不等于真正的计算路径少。

SVD成分的读方向和写方向通常都是稠密的。即使只保留少数成分,它们仍可能连接几乎所有输入和输出维度。

SWD则进一步把稀疏性施加到每个单元的读写连接上:少量单元对应的同时也是少量活跃连接。

团队还构造了两个能够精确还原GPT-2原权重的稠密对照:保留全部奇异值的full-rank SVD,以及采用随机正交基的Random-B。

两种分解都能在数值上精确复现原矩阵,但在相同的归因和消融流程下,需要更多活跃连接才能达到与SWD相同的任务表现。

这组对照表明,SWD的优势并不是“把矩阵拆开”这么简单,真正关键的是每个单元都具有稀疏的读写结构



△精确稠密分解对照。Full-rank SVD与Random-B都能精确还原原始权重,但需要比SWD更多的活跃连接才能达到相同的充分性或必要性要求。

不到1%的数据,仍能保持模型行为

在进行回路分析之前,首先要回答一个更基础的问题:把原权重换成稀疏分解之后,模型还是原来的模型吗?

团队使用留出文本上的交叉熵差值(CE delta)衡量替换保真度,并使用KL散度和替换位置的激活重构误差进行补充验证。CE delta越接近0,说明替换后的模型行为越接近原模型。

在GPT-2 Small第8层mlp.c_proj的单矩阵实验中,SWD仅使用数千个校准token就进入低CE误差区间;Transcoder和VPD-Recon-CI等训练型基线则需要约10⁶量级的optimizer-replay token才能接近这一替换质量。同样的趋势随后出现在Qwen2.5-0.5B、1.5B、3B和Qwen3.5-27B上。

综合论文中的单矩阵比较,在达到匹配替换保真度时,SWD使用的数据不到训练型替代表示的1%。这意味着,大量数据和长时间替代模块训练并不是获得高保真回路单元的必要前提。直接从预训练权重出发,也可以构造足够忠实的干预表面。



△GPT-2 Small单矩阵替换的CE delta随数据量变化。SWD使用少量校准数据即可进入低误差区域。



△Qwen2.5-3B与Qwen3.5-27B的单矩阵替换结果。横轴为构造替换表示所使用的token数,纵轴为相对稠密模型的CE delta。

保留时能支撑任务,移除时会破坏任务

高保真地复现原矩阵,只能说明所有瓶颈单元合在一起能够工作。真正的回路还必须满足两个更严格的条件:只保留少量选中单元时,任务行为仍然存在;只移除这些单元时,任务表现会明显下降。前者是充分性测试,后者是必要性测试。

团队先在独立训练划分上使用一阶任务归因对候选单元排序,再构造从top-1、top-2到top-k的嵌套回路,并在留出测试集上评估。回路成本同时使用两种口径衡量:选中了多少瓶颈单元,以及这些单元实际包含多少非零读写连接。

在GPT-2 Small的GreaterThan、IOI、Docstring和Gendered Pronoun四项任务上,SWD达到相同充分性或必要性要求时,通常需要比Transcoder和VPD-Recon-CI更少的单元和活跃连接。

把平均激活消融替换为零消融之后,这一优势依然保持。

这一结果也扩展到了Qwen2.5和Qwen3.5-27B。

换句话说,SWD得到的不只是一种低误差矩阵近似,而是一组真正能够接受因果检验的任务回路单元。



△GPT-2 Small的任务回路结果。曲线越低,表示达到相同充分性或必要性要求所需的活跃连接越少。



△Qwen3.5-27B的任务回路结果。SWD在大模型上仍能以较少活跃连接达到相应的因果测试要求。

从单矩阵扩展到27B、全模型和zero-data

SWD的验证并未停留在GPT-2的单个矩阵上。

在模型规模上,团队将相同的单矩阵替换和回路抽取流程扩展到Qwen2.5-0.5B、1.5B、3B,最终进一步验证至Qwen3.5-27B。

在27B模型的第31层mlp.down_proj上,SWD依然以显著更少的数据达到低CE delta,并以更少的活跃连接达到相当的充分性和必要性目标。

在替换范围上,团队进一步把GPT-2 Small 12个Transformer block中全部48个注意力和MLP权重矩阵替换为稀疏分解,同时保留embedding、LayerNorm、非线性函数和输出头。

由于局部近似误差会跨层累积,团队将SWD作为稀疏初始化,固定所有非零位置,只微调已经保留下来的因子值。得到的SWD-FT在连接数量不变的情况下,将模型CE从3.90降至3.44,略优于相近非零参数预算下稀疏预训练基线的3.45。

更值得注意的是,SWD-FT总计使用约2,060万个token,而稀疏预训练基线达到相近CE使用了28.84亿个token,前者同样不到后者的1%。这使得从现有稠密checkpoint出发构造全模型稀疏干预表面,成为一条极具吸引力的路线。

SWD还提供了一个更彻底的zero-data版本。在GPT-2 Small单矩阵实验中,它完全不使用校准文本,直接最小化原权重与分解权重之间的Frobenius误差。

结果显示,zero-data SWD在权重空间中更接近原矩阵;使用激活校准的SWD则在高稀疏度下更能保持典型文本上的模型行为。

即使完全不使用校准激活,zero-data SWD得到的瓶颈单元仍然能够抽取出有效任务回路。这为逐checkpoint、逐训练阶段追踪大模型内部结构提供了新的可能性。



△GPT-2 Small全模型替换。固定稀疏结构并微调保留的非零值后,模型CE从3.90降至3.44,同时保持活跃连接数量不变。



△Zero-data SWD。Zero-data SWD在权重空间中更接近原矩阵;activation-calibrated SWD在高稀疏度下更能保持典型文本上的模型行为。

从曲线走向具体单元:它们到底在做什么?

回路曲线证明了这些单元在因果测试中有效,但机制可解释性还关心另一个问题:这些单元能否呈现出可理解的模式?

团队在GreaterThan任务上,对GPT-2 Small全部9,208个候选mlp.c_proj瓶颈单元进行归因排序,并从第6、8、10层展示六个高排名单元。

随后,他们在独立的WikiText-2文本上收集每个单元的高激活上下文,并由GPT-5.5总结重复出现的语义模式。

六个单元中,有四个集中响应数字、年份、数量或度量信息,另外两个更多对应标点、句法和命名实体。

这些语义模式并未参与单元选择,却与GreaterThan所需的数值比较能力形成了明显呼应。

团队还进行了一个独立的定向编辑实验。他们筛选出瓶颈单元c205,并将该单元读方向诱导的rank-one更新施加到原始稠密GPT-2权重上。

在提示词The opposite of up is中,正确答案down相对干扰答案left的logit margin提高了0.216;在七条无关事实提示上,平均末token KL仅为4.02×10⁻⁵

在相近的正向目标变化下,这个单单元方向测得的副作用低于随机单元和rank-4 LoRA对照。

一个从权重分解中得到的瓶颈方向,因此不仅可以被观察和消融,还能够成为精确操控模型行为的编辑手柄。



△GreaterThan回路的语义审计。六个高归因瓶颈单元中,四个与数字、数量或度量模式相关;语义假设来自独立文本中的高激活上下文。



△单个SWD方向的定向编辑。纵轴为目标答案相对干扰答案的logit margin变化,横轴为无关提示上的平均末token KL。

直接从预训练权重中寻找大模型回路

过去,机制可解释性往往需要先学习一套新的特征字典或替代模块,再对这些新单元进行归因和干预。SWD展示了另一种可能:预训练权重本身就可以被重新组织成稀疏、可寻址、可因果检验的计算路径。

从不到1%的数据成本,到更少的瓶颈单元和活跃连接;从GPT-2、Qwen2.5到Qwen3.5-27B;从单矩阵、整个Transformer主干到完全不依赖校准文本的zero-data分解,SWD正在把权重侧机制可解释性变成一条更轻量、也更容易扩展的技术路线。

更重要的是,这些稀疏路径不只存在于数值曲线中:它们能够响应具体语义模式、通过充分性和必要性测试,并被用于定向改变模型行为。

随着模型规模不断增长,直接从已有checkpoint中抽取和追踪回路,或许将成为理解大模型内部计算的一条重要路径。

论文信息

  • 论文标题:Sparse Weight Decomposition for Efficient Circuit Extraction
  • 作者:Chuanhao Yan、Xuhan Huang、Yawen Duan、Zhenfei Yin、Hang Zhao、Bryan Dai、Jie Fu
  • 机构:IQuest Research、Safe AI Forum、University of Oxford、Stanford University、Tsinghua University
  • 论文:https://arxiv.org/abs/2608.03913
  • 代码:https://github.com/Veri-Safe/SWD
  • 模型:https://huggingface.co/veri-safe/SWD
  • 交互式博客:https://huggingface.co/spaces/veri-safe/SWD-Blog

*本文系量子位获授权刊载,观点仅为原作者所有。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
《抓特务》逆袭夺冠,观众刷屏道歉,暑期档最冤电影诞生了

《抓特务》逆袭夺冠,观众刷屏道歉,暑期档最冤电影诞生了

影视高原说
2026-08-31 14:59:17
原来他是陈观泰亲弟,哥哥经历4段婚姻,他是知名导演却低调生活

原来他是陈观泰亲弟,哥哥经历4段婚姻,他是知名导演却低调生活

胡一舸南游y
2026-09-02 15:07:58
女友认定路由器就是游戏机 于是暴怒砸家!

女友认定路由器就是游戏机 于是暴怒砸家!

游民星空
2026-09-01 18:16:26
广东男篮新帅亚科夫列维奇:我只用了5秒钟就作出执教决定

广东男篮新帅亚科夫列维奇:我只用了5秒钟就作出执教决定

南方都市报
2026-09-02 19:22:18
变脸,从宠儿到弃儿只要一年,被阿森纳嫌弃还是示爱巴萨遭惩罚

变脸,从宠儿到弃儿只要一年,被阿森纳嫌弃还是示爱巴萨遭惩罚

95帕尔马
2026-09-02 17:18:07
普京:如果北京认为有益,俄罗斯愿意将与中国之间的免签制度转为永久性

普京:如果北京认为有益,俄罗斯愿意将与中国之间的免签制度转为永久性

俄罗斯卫星通讯社
2026-09-01 15:23:46
荣格的智慧:底层人难以发财的根本原因,其实是身体太差

荣格的智慧:底层人难以发财的根本原因,其实是身体太差

阿胖读书
2026-08-24 16:10:53
美俄再次讨论俄乌停火计划,克宫要求乌克兰移交顿巴斯

美俄再次讨论俄乌停火计划,克宫要求乌克兰移交顿巴斯

山河路口
2026-09-01 13:35:37
尼泊尔“喜马拉雅的门户”小镇被整体埋进泥浆:全村90%房屋被埋、逾8成居民失联;当地议员:像一座孤岛

尼泊尔“喜马拉雅的门户”小镇被整体埋进泥浆:全村90%房屋被埋、逾8成居民失联;当地议员:像一座孤岛

三湘都市报
2026-09-02 23:51:58
深圳将新增一家山姆会员店!

深圳将新增一家山姆会员店!

深圳晚报
2026-09-02 16:31:56
把两箱人体尸块放进了火车站的安检机,这在全世界可能都从未发生过,2012年,他就这么干了

把两箱人体尸块放进了火车站的安检机,这在全世界可能都从未发生过,2012年,他就这么干了

法网恢恢
2026-08-31 23:36:05
意大利副议长会见赖清德,妄称“与台湾同在”,赖清德又遭重击

意大利副议长会见赖清德,妄称“与台湾同在”,赖清德又遭重击

梦史
2026-09-02 01:43:29
普京:中俄贸易今年还要破纪录——前7个月已达1592亿美元

普京:中俄贸易今年还要破纪录——前7个月已达1592亿美元

桂系007
2026-09-02 23:45:06
看到中国的成绩,李在明做了一个决定:掏65万美元,力求与华平行

看到中国的成绩,李在明做了一个决定:掏65万美元,力求与华平行

鹤羽说个事
2026-09-02 16:35:11
姆巴佩女友拒拍大尺度场景!要保护自己

姆巴佩女友拒拍大尺度场景!要保护自己

乡野小珥
2026-09-01 08:21:18
美国号召20国集团,围攻中国,俄财长单刀赴会,拍照时被踢出局

美国号召20国集团,围攻中国,俄财长单刀赴会,拍照时被踢出局

壹切的壹切
2026-09-01 15:52:29
马斯克:若是猎鹰1号第四次发射失败 SpaceX就会原地倒闭

马斯克:若是猎鹰1号第四次发射失败 SpaceX就会原地倒闭

快科技
2026-09-02 21:58:10
被杨瀚森打爆的黎巴嫩归化中锋芬德伯格到底是什么水平?

被杨瀚森打爆的黎巴嫩归化中锋芬德伯格到底是什么水平?

我们的美学
2026-09-02 09:08:36
巴菲特预言:20年或50年后,日本和美国都将更强大,中国呢?

巴菲特预言:20年或50年后,日本和美国都将更强大,中国呢?

经纬戎韬
2026-09-01 01:57:13
李想:新一代理想MEGA是全世界最好开最舒适的MPV

李想:新一代理想MEGA是全世界最好开最舒适的MPV

CNMO科技
2026-08-31 10:47:11
2026-09-03 00:31:00
量子位 incentive-icons
量子位
追踪人工智能动态
13247文章数 176547关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

艺术
旅游
教育
时尚
军事航空

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

旅游要闻

忻州荷花开 遍地是吾乡

教育要闻

幼稚!高考全省260名瞧不上2600名室友要退学,港中深校长当场说:半年后谁厉害还不一定

白衬衫不火了?早秋穿“棕色衬衫”更高级好看

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版