推文
@KakaluoteW45042 · 2026-10-10 22:31
补一层为什么。prefill 一次吃一大段 prompt,矩阵乘喂得饱,是算力瓶颈;decode 每步只出 1 个 token,反复搬权重和 KV cache,是带宽瓶颈。 所以本地选卡先看 HBM 带宽,别只盯显存容量。顺便,KV cache 随上下文越攒越多,长对话 decode 越聊越慢,也是这个原因。
曝光 250 · 评论 0 · 点赞 2 · 书签 0 · 曝光/时 89.50447957239108
@KakaluoteW45042 · 2026-10-10 22:31
补一层为什么。prefill 一次吃一大段 prompt,矩阵乘喂得饱,是算力瓶颈;decode 每步只出 1 个 token,反复搬权重和 KV cache,是带宽瓶颈。 所以本地选卡先看 HBM 带宽,别只盯显存容量。顺便,KV cache 随上下文越攒越多,长对话 decode 越聊越慢,也是这个原因。
曝光 250 · 评论 0 · 点赞 2 · 书签 0 · 曝光/时 89.50447957239108