把量化权重暂存成 FP8 而不是 fp16
@yibie · 2026-10-09 08:02
一个紧凑的模型文件并不能决定 GPU 实际执行的是哪种算术。我们在 M5、M5 Max 和 M6 上的实测说明了为什么这个区别对 MLX prefill 很重要。
曝光 951 · 评论 0 · 点赞 3 · 书签 7
@yibie · 2026-10-09 08:02
一个紧凑的模型文件并不能决定 GPU 实际执行的是哪种算术。我们在 M5、M5 Max 和 M6 上的实测说明了为什么这个区别对 MLX prefill 很重要。
曝光 951 · 评论 0 · 点赞 3 · 书签 7