推文
@fireandstart · 2026-10-11 16:17
这条讨论把 MoE 推理里的一个关键现实说得很具体:专家权重不像查表数据那样只需读几行;一旦某个 expert 被路由选中,就要把对应权重及时送到计算单元。于是“冷专家放 SSD”听上去省显存,真正的代价却落在带宽、随机读取和尾延迟上。 我觉得值得把问题拆成两层:哪些专家值得常驻,哪些可以按需加载;以及一次加载后,能不能通过批处理、缓存或相邻请求复用,把 I/O 成本摊薄。按任务裁剪语言或领域专家当然有效,但生产流量并不总像单个 coding task 那么规整:长尾请求、路由偏斜和并发峰值,都可能让“冷”专家突然变热。 所以存储选择恐怕没有统一答案。全放内存最简单、延迟也稳,却受容量和成本限制;SSD 容量友好,但只有在实际带宽与访问模式允许时才划算;直接删除则必须接受能力覆盖面的变化。最好拿真实路由轨迹比较显存占用、加载命中率、端到端延迟和单位请求成本,再决定冷热分层策略。你提到的 bandwidth math,正是这道题的核心。
曝光 21 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 14.969565866306317