推文
@Phoenixyin13 · 2026-10-11 14:00
Anthropic 的 superposition toy model 本质上就是一个带相图的统计物理问题,弱点是稀疏自编码器的可靠性仍有争议,关于找到的特征到底是否模型使用的问题,并没有被完全解决。 2022 年的 Toy Models of Superposition 很有价值,是因为它是构造了一个能够解释其出现条件的最小模型。当特征足够稀疏时,模型可以牺牲部分特征之间的正交性,以换取有限表示空间中更高的特征容量。 从统计物理角度看,这相当于研究容量约束、稀疏性与干扰之间的竞争,以及最优表示结构如何随着控制参数发生变化。 不过在这里,先保留一个严格的区别。有限维 toy model 中观察到的 phase change,不自动等于热力学极限下的真正相变。 要进一步讨论临界指数、普适类等概念,还需要有限尺寸标度分析。 SAE 的问题,比解释不够准确更深刻。 2025 年 ICLR 的 Sparse Autoencoders Do Not Find Canonical Units of Analysis 提供了一个很关键的反例。SAE 学到的特征可能是不完整的,也未必是不可再分的原子单元。更大的字典有时会发现新特征,而一些已发现的特征又能被进一步分解。 那么,人类是在发现模型内部客观存在的计算单元,还是在为同一个计算过程寻找一种方便人类理解的坐标系呢? 毕竟,两者并不等价。 2025 年 ICML 的 SAEBench 也发现,重构误差、稀疏性等代理指标上的提升,并不可靠地转化为实际解释任务上的改进。 但这并非意味着 SAE 没有价值。 2026 年的一项研究发现,不同随机种子下单个特征可能不稳定,但它们所张成的低维子空间可能具有可复现性。这暗示稳定的对象有时可能是子空间,而非某一根特征向量。 我这里提出的问题是,Superposition 的表示相图,与 SAE 的特征可恢复性相图,是否存在系统性的对应关系? 比如说,在同一个 toy model 中独立改变输入稀疏性、表示维度和特征相关性,训练多个随机种子的模型,再比较 SAE 对真实生成特征的恢复程度。 不仅看重构误差,还同时检验特征恢复率、跨种子稳定性,以及通过干预对模型行为产生的可重复因果影响。后者尤其需要排除非目标特征受到连带扰动的可能。 这样可以测试一个具体假设。进入更强 superposition 的区域后,SAE 会出现某种可预测的恢复失败。 我能想到的更有趣的结果是表示的几何结构发生明显变化,但 SAE 的可恢复性边界完全不与之重合。 这同样会告诉我们一些更好玩的东西。 这比笼统地研究深度学习中的涌现现象有价值得多。 它同时要求统计物理的建模直觉、线性代数与优化知识,以及实际训练和评估神经网络的能力。 而且,即使最终发现两种相图并不对应,实验依然有意义。
曝光 1039 · 评论 0 · 点赞 10 · 书签 9 · 曝光/时 234.48569366972575