TwKit

推文

@alacheng · 2026-10-09 19:00

这个x主对transformer的理解挺深刻。 1/ “不要把 transformer 想成一个管道:好像每一层都在转换前一层的输出。” 理解:每个 block 里的 attention 或 MLP(也就是 (f))并不是把输入“变成”新的东西,而是算出一份要加回去的增量。原输入 (x) 通过残差连接原样加回去,所以信息主要是被“追加”,不是被覆盖。 2/“开始把它想成一个残差流” 每个 transformer 块都有一个残差连接,将块的输入加回到它的输出上。 x' = f(x) + x 这种“加法”连接意味着一层内部的注意力/MLP 块(上面的函数 f)实际上并没有转换输入——相反,它计算出在传递到下一个块之前必须添加到输入上的信息 3/把整个 transformer 主干想象成一个共享的白板。每个块从白板上读取它需要的东西,并将它的笔记写在白板上。累加的改变。 事实上,层之间可以远距离交流。第 1 层的一个块可以写入信息,第 5 层的一个块可以读取它,尽管它们之间没有直接的连线。 理解:整条 backbone 是同一块白板。 每一层读白板上已有的内容,再把自己的笔记写上去(加法)。第 1 层写的东西,第 5 层仍然能读到,中间不需要专门连一根线。因为中间层只是在原向量上继续加,早期写入的方向不会被擦掉。 加输入,是因为这一层算出来的不是“新的完整表示”,而是一份要叠到原向量上的修正。

曝光 567 · 评论 1 · 点赞 6 · 书签 10 · 曝光/时 289.58736836520103