
至知研究院提出的SWD方法,通过将稠密权重矩阵直接分解为两个稀疏矩阵来提取可干预的瓶颈单元,避免了训练昂贵的替代网络。该方法在达到相同替换保真度时,数据成本不到训练型基线的1%,并已在GPT-2、Qwen系列等模型上验证了其有效性。
在人工智能领域,大模型的“黑箱”问题一直是研究的核心挑战。为了理解一个已训练完成的模型,传统机制可解释性研究往往陷入一种略显矛盾的境地:研究者需要先训练一个全新的、更简单的“替代网络”来近似原模型的行为,再通过分析这个替代网络来间接理解原模型。这种依赖训练型稀疏表示(如Transcoder)的方法,虽然推动了领域发展,但不仅引入了额外的数据与计算成本,更关键的是,如果替代模块未能完美复现原模型,后续的分析结论就可能混淆了“模型真实行为”与“替代误差”。
至知创新研究院(IQuest Research)联合Safe AI Forum、牛津大学、斯坦福大学及清华大学的研究者,近期提出了一种名为稀疏权重分解(Sparse Weight Decomposition,SWD)的新路线,旨在绕开“训练替代网络”这一环节,直接从预训练权重中“拆解”出可干预的单元。相关论文《Sparse Weight Decomposition for Efficient Circuit Extraction》已公开在 arXiv 上。
SWD方法的出发点非常直接:对于预训练模型中的任意稠密权重矩阵W,尝试寻找两个稀疏矩阵A和B,使得它们的乘积近似等于W(W ≈ AB)。这两个矩阵共享的中间维度,构成了一个个“瓶颈单元”。每个单元本质上是一条固定的rank-one读写路径:它先通过A的一列从输入中读取一个标量,再通过B的一行将其写入输出。
可以将这个过程想象成在原本密集的交通网络中增设“中转站”,每个站点仅连接少量入口与出口。研究者不仅能清晰看到信息的流向,还能单独“关闭”某个站点,观察模型行为的变化,从而实现精准的因果干预。SWD的优化目标是通过少量校准文本产生的层输入,最小化分解前后的输出误差,并利用硬阈值来维持非零预算,最终得到一组稀疏、可寻址且能通过因果检验的计算路径。
既然目标是直接分解权重,一个自然的问题是:为何不直接使用经典的奇异值分解(SVD)?SVD同样能将矩阵分解为rank-one成分之和,且无需训练数据。然而,SVD成分的读方向和写方向通常是稠密的,这意味着即使只保留少数几个成分,它们仍可能连接到几乎所有输入与输出维度,难以形成清晰的“稀疏回路”。
SWD的关键创新在于,它将稀疏性施加到了每个单元的读写连接上。团队通过构造能够精确还原GPT-2原权重的full-rank SVD和随机正交基(Random-B)作为对照实验,发现在相同的归因与消融流程下,这两种精确分解方法需要比SWD更多的活跃连接才能达到相同的任务表现。这一对照有力地证明,SWD的优势并非仅仅源于“矩阵分解”,而是其每个单元独特的稀疏读写结构。
在进行回路分析前,首要问题是验证替换后的模型是否“还是原来的模型”。团队使用留出文本上的交叉熵差值(CE delta)作为保真度指标。实验结果显示,在GPT-2 Small的单矩阵实验中,SWD仅需数千个校准token就能进入低CE误差区间,而Transcoder等训练型基线则需要约10⁶量级的token。综合来看,在达到相同替换保真度时,SWD所需的数据量不到训练型方法的1%。这一趋势在Qwen2.5系列(0.5B至3B)乃至Qwen3.5-27B上均得到验证,表明直接基于预训练权重构造高保真干预表面是完全可行的。
高保真复现只是第一步,真正的任务回路必须通过更严格的因果测试:充分性(只保留少量选中单元,任务能力依旧存在)与必要性(移除这些单元,任务表现显著下降)。团队在GPT-2 Small的GreaterThan、IOI等任务上,以及Qwen系列模型上,验证了SWD提取的回路单元通常能以更少的瓶颈单元和活跃连接达到与训练型基线相同的因果测试目标。这些结果证明,SWD得到的不仅是低误差的矩阵近似,更是一组真正能够接受因果检验、具备可解释性的任务单元。
SWD的验证并未止步于单矩阵。团队将流程成功扩展到GPT-2 Small全部48个注意力与MLP权重矩阵的替换。针对局部误差跨层累积的问题,他们采用SWD作为稀疏初始化并微调保留的非零值(SWD-FT),在保持活跃连接数量不变的情况下,将模型困惑度从3.90降至3.44。更值得注意的是,SWD-FT仅使用约2060万token,而达到相近效果的稀疏预训练基线则需28.84亿token。此外,SWD还提供了完全不依赖校准文本的zero-data版本,通过直接最小化Frobenius误差,在权重空间中实现更接近原矩阵的分解,为逐阶段追踪大模型内部结构提供了新的可能性。
为了探究这些稀疏单元是否具有可理解的语义,团队在GreaterThan任务上对GPT-2 Small的瓶颈单元进行归因排序,并利用GPT-5.5分析其高激活上下文。结果显示,六个高排名单元中有四个集中响应数字、年份、数量等与数值比较相关的模式。更进一步的定向编辑实验表明,对单个单元(如c205)施加特定的rank-one更新,可以精准改变模型在特定提示上的输出倾向,且副作用极小。这为利用权重分解结果进行精确的模型行为操控提供了实证支持。
大模型可解释性已成为全球AI领域的关注焦点,国内学术界与工业界也在该方向积极布局。虽然至知研究院的SWD方法在权重分解路线上具有创新性,但国内其他机构也在探索不同的技术路径。例如,中科院自动化研究所提出的GMC核心集剪枝方法,旨在通过剪枝技术减少80%的Token使用量,同时保持多模态能力的高保真,这代表了从数据效率角度提升可解释性的另一种思路。此外,国内主流大模型厂商如百度(文心一言)、阿里(通义千问)等,也在其模型迭代中不断融入可解释性模块,以增强模型输出的可信度与可控性。这些多元化的探索共同推动着大模型从“能用”向“可信”迈进。
SVD分解出的成分其读写方向通常是稠密的,难以形成清晰的稀疏回路。而SWD在分解过程中对每个单元的读写连接施加了稀疏性约束,使得少数单元对应的也是少量活跃连接,从而更容易抽取出可因果检验的任务回路。
根据论文实验结果,在达到相同替换保真度时,SWD使用的校准数据量不到Transcoder等训练型基线的1%。例如,在GPT-2 Small单矩阵实验中,SWD仅需数千token,而基线方法需要约10⁶量级。
不是。论文已验证SWD方法可扩展到Qwen3.5-27B等大型模型上,并成功应用于GPT-2 Small的整个Transformer主干(全部48个注意力与MLP矩阵),展示了其良好的扩展性。
是的。团队在GreaterThan任务上对高归因单元进行语义审计,发现多个单元集中响应数字、数量等与任务相关的模式。此外,定向编辑实验也证明,通过调整单个SWD方向可以精准影响模型行为,且副作用极小。
zero-data SWD是SWD的一个变体,它完全不使用任何校准文本,直接通过最小化权重矩阵间的Frobenius误差来进行分解。实验表明,它在权重空间中更接近原矩阵,且其提取的单元仍能有效用于任务回路分析。
SWD方法为机制可解释性研究提供了一条“更轻量、更直接”的技术路径。它证明了预训练权重本身就可以被重新组织为稀疏、可寻址且能通过因果检验的计算路径,无需再训练一个“第二黑箱”。随着模型规模的持续增长,直接从已有checkpoint中高效抽取和追踪回路,有望成为理解大模型内部计算的关键工具。
论文信息
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI 最新研究通过训练稀疏神经网络,让模型内部计算更易理解。该方法通过强制大多数权重为零,构建解耦的电路,在保持性能的同时显著提高可解释性,为构建更安全的 AI 系统提供新路径。

小米通过玄戒技术沟通会展示了从手机 SoC 到 AI 加速芯片、智驾芯片的完整布局。O3 以 10 核全大核架构刷新性能纪录,O100 通过 3D 堆叠实现 1.22TB/s 带宽,D100 则瞄准 200B 大模型本地部署,展现了小米在端侧 AI 算力领域的系统化思考。

Omarchy 4.0 尝试将 AI 从应用层下沉到系统层,让自然语言成为人机交互的核心协议。文章分析了其技术理念、八位硅谷巨头的 800 万美元注资背后的战略意义,以及社区驱动的插件生态爆发,并对比了国内 AI 与操作系统融合的渐进式路径。
最新の SEO・GEO 情報をお届けします。
プライバシーを尊重します。いつでも購読を解除できます。