推文
@Zen_with_AI · 2026-10-09 00:03
第6期ML面试问题 Q:Batch Normalization 是什么?训练和推理时有什么不一样? A: 批量归一化 Batch Normalization 每个 mini-batch 内,对每个神经元的输入算均值方差做标准化,再用可学习的 γ/β 缩放平移回去。每层输入分布稳定了,训练更快更稳。比如深层网络里前几层参数一动、后面全乱,BN 把每一层的输入都"拉回正轨"。 训练 vs 推理 训练时用当前 batch 的均值方差;推理时 batch 可能只有 1 条样本,统计量没意义,所以改用训练期攒下的滑动平均 running mean/variance,BN 退化成一个固定的线性变换。 (一句话记住:训练看当批,推理看老账本) 追问加分:BN 为什么能加速训练?输入分布稳定、梯度不炸、学习率可以更大;新一点的解释是它让损失曲面更平滑了。 更深度问题:batch 很小的时候 BN 会出什么问题?Transformer 为什么改用 LayerNorm?
曝光 721 · 评论 6 · 点赞 11 · 书签 5 · 曝光/时 132.90439002376084