TwKit

推文

@NFT_Chen · 2026-10-09 08:00

🔥必读!Qwen 负责人刘大一恒团队把极稀疏 MoE 的负载不均当成闭环控制来解!这对Qwen 4.0 而言意义重大! 他们发现:专家池越大、每 token 只点亮一小撮,容量能涨、推理成本几乎不动。DeepSeekMoE 16B 是 64 专家选 6 个(激活约 9.4%),Kimi K3 已到 896 专家选 16 个(约 1.8%)。再往 5 万亿、10 万亿走,热门专家会打满 GPU,闲置专家却训不透。 ID Balancing 的关键点: 1️⃣给现有方法定身份。DeepSeek 的 loss-free 是固定步长积分控制,Kimi K3 的 Quantile Balancing 是广义比例控制,都是不完整 PID。 2️⃣新方法是 ID 控制器,不用辅助 loss。积分项按负载误差缩放,偏得越大纠得越猛,接近均衡就收步;微分项只在失衡正在恶化时打开,提前刹车。 3️⃣768 专家、Top-10 / Top-5 / Top-3 对比。最稀的 Top-3 里,相对最好基线,主干最坏 MaxVio 降超过 50%,训练平均 MinVio 降超过 12%。辅助 loss 的 MaxVio 可飙到约 211,ID Balancing 约 15。 4️⃣规模从 18.9B 拉到 69.9B,最坏 MaxVio 几乎不动(约 8.4→7.8),比辅助 loss 低约 89.6%。越稀疏优势越大,语言建模和下游不掉点。 大误差大力纠,恶化才加导数,靠近均衡就收手。 论文:https://arxiv.org/abs/2609.39137 #MoE #Qwen #刘大一恒 #稀疏MoE #PID #阿里巴巴 #Qwen4

曝光 3469 · 评论 5 · 点赞 26 · 书签 23