机制可解释性研究一直有个略显尴尬的反差:想理解一个已经训练好的模型,研究者往往得先训练另一个模型。Transcoder、稀疏特征模块这类方法,都要先学一套新的内部单元去近似原模型某一层,再靠保留或移除这些单元来找任务回路。想打开黑箱,先得造出第二个稍小一点的黑箱。
至知创新研究院(IQuest Research)联合 Safe AI Forum、牛津、斯坦福、清华提出了更直接的路线:Sparse Weight Decomposition(SWD,稀疏权重分解)。它不再训练替代网络,而是把预训练模型的稠密权重矩阵直接分解成两个稀疏矩阵,让二者共享的中间维度变成可独立评分、选择和消融的瓶颈单元。结果是:抽取任务回路所需的数据,不到训练型基线的 1%,并且从 GPT-2 一路验证到 Qwen3.5-27B。
开黑箱的隐性成本
旧路线的代价不止是算力。替代模块需要数据和优化,一旦它没有忠实复现原模块,后续分析解释的就同时是模型和替换误差。任务回路还要求单元能独立干预:只保留它们,能力仍在;移除它们,表现明显下降。而训练型替代表示往往要按不同模型、不同层、不同 checkpoint 分别拟合,系统性的大规模回路分析因此很贵。
论文把理想方案定成三个条件同时满足:保持原模型行为、提供可独立干预的单元、能低成本直接从已有权重构造。SWD 就是冲着这三点设计的。
把权重拆成稀疏读写路径
对稠密权重矩阵 W,SWD 找到两个稀疏矩阵 A、B,使 W ≈ A·B。A、B 共享 m 个中间维度:A 的第 i 列从输入读出一个标量,B 的第 i 行把它写向输出,一列加一行就是一个瓶颈单元,即一条固定的 rank-one 读写路径。
可以把它想象成在极其密集的路网里加一批”中转站”:每个站只连少量入口和出口,你能看到一条路径从哪里读、向哪里写,还能单独关掉某条路径观察模型行为。分解时 SWD 用少量校准文本最小化拆分前后的输出误差,交替更新两个因子,用硬阈值维持非零预算,再对保留的权重值做重拟合。
三个结果值得注意:
- 数据不到 1%。 在 GPT-2 Small 第 8 层矩阵上,SWD 只用几千个校准 token 就进入低交叉熵误差区间,而 Transcoder、VPD-Recon-CI 等训练型基线需要约 10⁶ 量级的 optimizer-replay token 才接近;同样的趋势出现在 Qwen2.5-0.5B/1.5B/3B 和 Qwen3.5-27B 上。
- 同样的因果检验,单元更少。 在 GreaterThan、IOI、Docstring、Gendered Pronoun 四项任务上,SWD 达到相同充分性/必要性要求时,通常比训练型基线用更少的瓶颈单元和活跃连接。
- 全模型与 zero-data 版本。 SWD 覆盖了 GPT-2 Small 全部 48 个注意力与 MLP 权重矩阵;微调版 SWD-FT(固定稀疏结构、只重拟合非零值)把模型 CE 从 3.90 降到 3.44——约用 2060 万 token,而达到相近 CE 的稀疏预训练基线用了 28.84 亿 token,同样不到 1%。zero-data 版本完全不依赖校准文本,只最小化原权重与分解权重间的 Frobenius 误差,依然能抽取出有效回路。
为什么不是直接用 SVD?
奇异值分解同样能把矩阵写成 rank-one 成分之和,而且不需要训练数据;近期的 NaNA 等方法也证明 SVD 成分可用于任务排序和干预。那 SWD 的意义在哪?
关键在于:对回路分析而言,单元少不等于计算路径少。SVD 成分的读写方向通常是稠密的,哪怕只保留少数成分,它们仍可能连接几乎全部输入输出维度。SWD 则把稀疏性施加到每个单元的读写连接上——少量单元对应少量活跃连接。论文的对照实验说得很清楚:full-rank SVD 和随机正交基分解都能精确还原原矩阵,但要达到与 SWD 相同的任务表现,需要多得多的活跃连接。真正的优势不是”把矩阵拆开”,而是每个单元稀疏的读写结构。
回路抽取正在变成审计面
机制可解释性长期被当作昂贵的研究副业。SWD 直接打的是成本曲线:当你可以用不到 1% 的数据从任意 checkpoint 里拆出回路时,回路抽取就不再只是研究爱好,而会变成工程与审计面。
三个含义值得关注:
- 审计模型”藏着”的能力。 能低成本追踪驱动某项能力的电路,就能检查模型是否隐藏了未声明的能力。这与持续深入的隐藏思维链提取研究一脉相承——都是不轻信模型表面行为、直接读内部。
- 精准的”模型手术”。 团队用单个瓶颈单元 c205 演示了定向编辑:把该单元读方向的 rank-one 更新施加到 GPT-2 原始权重上,“The opposite of up is” 的正确答案边际提升 0.216,副作用(末 token 平均 KL 4.02×10⁻⁵)低于随机单元和 rank-4 LoRA 对照。低附带损伤的定向编辑不再是纸上谈兵。
- 开源权重成为审计资产。 当任何人都能分解一个已发布 checkpoint 并检查其内部结构,“开放”就获得了具体的安全论据——这正是开源安全转向背后的逻辑。
可以怎么做
研究者可以看论文(arXiv:2608.03913),代码(GitHub)、权重(HuggingFace)和交互式博客都开源了——最快上手方式就是自己跑一遍 GreaterThan demo。
基于开源模型做产品、做部署的团队:把权重侧分解加入上线前的审计流程。现在它已经便宜到可以成为流水线的一部分,而不是一次性的研究项目。
做安全与治理的人:关注 zero-data 变体。能够逐 checkpoint、逐训练阶段追踪内部回路,正是把”可解释性”从研究问题变成监控工具的抓手。