保温护角专用胶

大模型机制可解释研究中达州pvc管道管件胶,直存在个颇具反差的现实:

为了理解个已经训练好的模型,研究者往往需要先训练套新的稀疏表示。

Transcoder、稀疏特征模块等法会学习组新的内部单元,用它们近似原模型某层或某个模块的计,再通过保留、移除这些单元来寻找任务回路。

这些法动了机制可解释的发展,但也带来了笔不小的额外成本:新的表示需要数据和优化,而且旦替代模块没有充分复现原模块,后续分析就可能同时解释模型行为和替换误差。

说白了,研究者想开个黑箱,却往往需要先训练另个"小黑箱"。

问题不只是训练成本。任务回路需要找到组可以立干预的内部计:只保留它们时,相关能力仍然存在;移除它们时,模型表现则明显下降。

训练型替代表示通常还需要针对不同模型、层和 checkpoint 分别拟,使大规模、系统的回路分析加困难。

理想的案应当同时保持原模型行为、提供可立干预的单元,并能以较低成本直接从已有权重中构造。

至知创新研究院(IQuest Research)与 Safe AI Forum、牛津大学、斯坦福大学、清华大学的作者提出了条直接的路线:

不再训练套立替代网络,而是从现有的预训练权重中直接"拆"出可干预单元。

这套法名为稀疏权重分解(Sparse Weight Decomposition,SWD)。

它把个稠密权重矩阵分解为两个稀疏矩阵,并把二者共享的中间维度变成可立评分、选择和消融的瓶颈单元。研究者由此可以直接在权重上抽取任务回路。

论文给出了三个值得关注的结果:

在匹配替换保真度的单矩阵实验中,SWD 使用的数据不到 Transcoder 等训练型基线的 1;

在 GPT-2、Qwen2.5 和 Qwen3.5-27B 的任务回路实验中,SWD 通常以少的瓶颈单元和活跃连接达到相同的充分、要目标;

法不仅扩展到了 27B 模型,还覆盖了 GPT-2 Small全部 48 个注意力和 MLP 权重矩阵,并提供了不需要校准文本的 zero-data 版本。

论文地址:https://arxiv.org/abs/2608.03913

△SWD 法概览。预训练模型中的稠密权重被分解为两个稀疏因子,共享中间坐标成为可立评分、选择和消融的瓶颈单元。直接把权重拆成"稀疏路径"

SWD 的出发点很简单。对于预训练模型中的稠密权重矩阵 W,寻找两个稀疏矩阵 A 和 B,使得

W ≈ AB.达州pvc管道管件胶

A 和 B 共享 m 个中间维度。 i 个维度先通过 A 的 i 列从输入中读出个标量,再通过 B 的 i 行写向输出。这样,列和行共同构成个瓶颈单元,也就是条固定的 rank-one 读写路径。

可以把它想象成在张其密集的交通网络中增加组"中转站":每个中转站只连接少量入口和出口。研究者不仅可以看到条路径从哪里读取、向哪里写入,还可以单关闭它,观察模型行为会发生什么变化。

真正困难的地,是如何在大幅减少连接的同时,仍然保留原权重对模型激活的作用。SWD 使用少量校准文本产生的层输入,优化分解前后的输出误差;求解过程中交替新两个因子,通过硬阈值维持非预,并重新拟保留下来的权重值。分解完成后,每个瓶颈单元都可以像稀疏特征样参与任务归因、排序和消融,但不需要再训练套立的经替代网络。

△从权重分解到回路抽取。Step 1 将稠密权重分解为稀疏因子 A 和 B;Step 2 按任务归因对瓶颈单元排序,并选择 top-k 单元组成任务回路。已经有 SVD,为什么还需要 SWD?

既然目标是直接分解权重,个自然的问题是:为什么不直接使用奇异值分解(SVD)?

SVD 同样可以把个矩阵表示为 rank-one 成分之和,而且不需要训练数据。近期的 NaNA 等法也已经证明,SVD 成分可以用于任务排序和干预。

但对回路分析而言,单元数量少,并不等于真正的计路径少。

SVD 成分的读向和写向通常都是稠密的。即使只保留少数成分,它们仍可能连接几乎所有输入和输出维度。

SWD 则进步把稀疏施加到每个单元的读写连接上:少量单元对应的同时也是少量活跃连接。

团队还构造了两个能够精确 GPT-2 原权重的稠密对照:保留全部奇异值的 full-rank SVD,以及采用随机正交基的 Random-B。

两种分解都能在数值上精确复现原矩阵,但在相同的归因和消融流程下,需要多活跃连接才能达到与 SWD 相同的任务表现。

这组对照表明,SWD 的优势并不是"把矩阵拆开"这么简单,真正关键的是每个单元都具有稀疏的读写结构。

△精确稠密分解对照。Full-rank SVD 与 Random-B 都能精确原始权重,但需要比 SWD 多的活跃连接才能达到相同的充分或要要求。不到 1 的数据,仍能保持模型行为

在进行回路分析之前,先要回答个基础的问题:把原权重换成稀疏分解之后,模型还是原来的模型吗?

团队使用留出文本上的交叉熵差值(CE delta)衡量替换保真度,并使用 KL 散度和替换位置的激活重构误差进行补充验证。CE delta 越接近 0,说明替换后的模型行为越接近原模型。

在 GPT-2 Small 8 层 mlp.c_proj 的单矩阵实验中,SWD 仅使用数千个校准 token 就进入低 CE 误差区间;Transcoder 和 VPD-Recon-CI 等训练型基线则需要约 10 ⁶量的 optimizer-replay token 才能接近这替换质量。同样的趋势随后出现在 Qwen2.5-0.5B、1.5B、3B 和 Qwen3.5-27B 上。

综论文中的单矩阵比较,在达到匹配替换保真度时,SWD 使用的数据不到训练型替代表示的 1。这意味着,大量数据和长时间替代模块训练并不是获得保真回路单元的要前提。直接从预训练权重出发,也可以构造足够忠实的干预表面。

△GPT-2 Small 单矩阵替换的 CE delta 随数据量变化。SWD 使用少量校准数据即可进入低误差区域。

△Qwen2.5-3B 与 Qwen3.5-27B 的单矩阵替换结果。横轴为构造替换表示所使用的 token 数,纵轴为相对稠密模型的 CE delta。保留时能支撑任务,移除时会破坏任务

保真地复现原矩阵,只能说明所有瓶颈单元在起能够工作。真正的回路还须满足两个严格的条件:只保留少量选中单元时,保温护角专用胶任务行为仍然存在;只移除这些单元时,任务表现会明显下降。前者是充分测试,后者是要测试。

团队先在立训练划分上使用阶任务归因对候选单元排序,再构造从 、top-2 到 top-k 的嵌套回路,并在留出测试集上评估。回路成本同时使用两种口径衡量:选中了多少瓶颈单元,以及这些单元实际包含多少非读写连接。

在 GPT-2 Small 的 GreaterThan、IOI、Docstring 和 Gendered Pronoun 四项任务上,SWD 达到相同充分或要要求时,通常需要比 Transcoder 和 VPD-Recon-CI 少的单元和活跃连接。

把平均激活消融替换为消融之后,这优势依然保持。

这结果也扩展到了 Qwen2.5 和 Qwen3.5-27B。

换句话说,SWD 得到的不只是种低误差矩阵近似,而是组真正能够接受因果检验的任务回路单元。

△GPT-2 Small 的任务回路结果。曲线越低,表示达到相同充分或要要求所需的活跃连接越少。

△Qwen3.5-27B 的任务回路结果。SWD 在大模型上仍能以较少活跃连接达到相应的因果测试要求。从单矩阵扩展到 27B、全模型和 zero-data

SWD 的验证并未停留在 GPT-2 的单个矩阵上。

在模型规模上,团队将相同的单矩阵替换和回路抽取流程扩展到 Qwen2.5-0.5B、1.5B、3B,终进步验证至 Qwen3.5-27B。

在 27B 模型的 31 层 mlp.down_proj 上,SWD 依然以显著少的数据达到低 CE delta,并以少的活跃连接达到相当的充分和要目标。

在替换范围上,团队进步把 GPT-2 Small 12 个 Transformer block 中全部 48 个注意力和 MLP 权重矩阵替换为稀疏分解,同时保留 embedding、LayerNorm、非线函数和输出头。

由于局部近似误差会跨层累积,团队将 SWD 作为稀疏初始化,固定所有非位置,只微调已经保留下来的因子值。得到的 SWD-FT 在连接数量不变的情况下,将模型CE 从 3.90 降至 3.44,略优于相近非参数预下稀疏预训练基线的 3.45。

值得注意的是,SWD-FT 总计使用约 2,060 万个 token,而稀疏预训练基线达到相近 CE 使用了28.84 亿个 token,前者同样不到后者的 1。这使得从现有稠密 checkpoint 出发构造全模型稀疏干预表面,成为条具吸引力的路线。

SWD 还提供了个的 zero-data 版本。在 GPT-2 Small 单矩阵实验中达州pvc管道管件胶,它不使用校准文本,直接小化原权重与分解权重之间的 Frobenius 误差。

结果显示,zero-data   SWD 在权重空间中接近原矩阵;使用激活校准的 SWD 则在稀疏度下能保持典型文本上的模型行为。

即使不使用校准激活,zero-data   SWD 得到的瓶颈单元仍然能够抽取出有任务回路。这为逐 checkpoint、逐训练阶段追踪大模型内部结构提供了新的可能。

△GPT-2 Small 全模型替换。固定稀疏结构并微调保留的非值后,模型CE 从 3.90 降至 3.44,同时保持活跃连接数量不变。

△Zero-data SWD。Zero-data SWD 在权重空间中接近原矩阵;activation-calibrated SWD 在稀疏度下能保持典型文本上的模型行为。从曲线走向具体单元:它们到底在做什么?

回路曲线证明了这些单元在因果测试中有,但机制可解释还关心另个问题:这些单元能否呈现出可理解的模式?

团队在 GreaterThan 任务上,对 GPT-2 Small 全部 9,208 个候选 mlp.c_proj 瓶颈单元进行归因排序,并从 6、8、10 层展示六个排名单元。

随后,他们在立的 WikiText-2 文本上收集每个单元的激活上下文,并由 GPT-5.5 总结重复出现的语义模式。

六个单元中,有四个集中响应数字、年份、数量或度量信息,另外两个多对应标点、句法和命名实体。

这些语义模式并未参与单元选择,却与 GreaterThan 所需的数值比较能力形成了明显呼应。

团队还进行了个立的定向编辑实验。他们筛选出瓶颈单元 c205,并将该单元读向诱的 rank-one 新施加到原始稠密 GPT-2 权重上。

在提示词 The opposite of up is 中,正确答案 down 相对干扰答案 left 的logit margin 提了 0.216;在七条关事实提示上,平均末 token KL 仅为 4.02 × 10 ⁻⁵。

在相近的正向目标变化下,这个单单元向测得的作用低于随机单元和 rank-4 LoRA 对照。

个从权重分解中得到的瓶颈向,因此不仅可以被观察和消融,还能够成为精确操控模型行为的编辑手柄。

△GreaterThan 回路的语义审计。六个归因瓶颈单元中,四个与数字、数量或度量模式相关;语义假设来自立文本中的激活上下文。

△单个 SWD 向的定向编辑。纵轴为目标答案相对干扰答案的 logit margin 变化,横轴为关提示上的平均末 token KL。直接从预训练权重中寻找大模型回路

过去,机制可解释往往需要先学习套新的特征字典或替代模块,再对这些新单元进行归因和干预。SWD 展示了另种可能:预训练权重本身就可以被重新组织成稀疏、可寻址、可因果检验的计路径。

从不到 1 的数据成本,到少的瓶颈单元和活跃连接;从 GPT-2、Qwen2.5 到 Qwen3.5-27B;从单矩阵、整个 Transformer 主干到不依赖校准文本的 zero-data 分解,SWD 正在把权重侧机制可解释变成条轻量、也容易扩展的技术路线。

重要的是,这些稀疏路径不只存在于数值曲线中:它们能够响应具体语义模式、通过充分和要测试,并被用于定向改变模型行为。

随着模型规模不断增长,直接从已有 checkpoint 中抽取和追踪回路,或许将成为理解大模型内部计的条重要路径。

论文信息

论文标题:Sparse Weight Decomposition for Efficient Circuit Extraction

作者:Chuanhao Yan、Xuhan Huang、Yawen Duan、Zhenfei Yin、Hang Zhao、Bryan Dai、Jie Fu

机构:IQuest Research、Safe AI Forum、University of Oxford、Stanford University、Tsinghua University

论文:https://arxiv.org/abs/2608.03913

代码:https://github.com/Veri-Safe/SWD

模型:https://huggingface.co/veri-safe/SWD

交互式博客:https://huggingface.co/spaces/veri-safe/SWD-Blog

* 本文系量子位获授权刊载,观点仅为原作者所有。

键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

� � 点亮星标 � �

科技前沿进展每日见相关词条:罐体保温     塑料挤出设备     钢绞线    超细玻璃棉板    万能胶

奥力斯    pvc管道管件胶批发    联系人:王经理    手机:15226765735(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》达州pvc管道管件胶,以此来变相勒索商家索要赔偿的违法恶意行为。