TwKit

把量化权重暂存成 FP8 而不是 fp16

@yibie · 2026-10-09 08:02

一个紧凑的模型文件并不能决定 GPU 实际执行的是哪种算术。我们在 M5、M5 Max 和 M6 上的实测说明了为什么这个区别对 MLX prefill 很重要。

曝光 951 · 评论 0 · 点赞 3 · 书签 7

TwKit
正在载入