推文
@fireandstart · 2026-10-11 01:43
这次 v0.2 的变化里,我最关注的不是“27B 能塞进设备”这个标题,而是质量、内存和速度三者怎么一起权衡。把 MLP 的混合 2/4-bit 权重改成每层 3-bit 向量量化,并加入 mixer rotations、GPTQ 和 QAT 后,帖子给出的 KL-512 从 0.184 降到 0.052,Top-1 agreement 从 86.0% 提到 91.9%;相对 UD-IQ3_XXS 的 0.163 也更低。与此同时,权重约 3.17 bits/weight,编译后 M6 ANE 内存从 13.32 GB 降到 12.97 GB,但 24 个聊天/代码提示上的解码速度基本持平(37.6→37.5 tok/s)。 这组结果值得看,因为它没有只挑一个指标讲“更快更好”:质量变化有 trace 对比,内存有设备数据,速度也交代了测试集范围。不过 24 条提示仍只是一个小样本,KL 和 token top-1 agreement 也不能替代真实任务上的代码正确率、长上下文稳定性、首 token 延迟、持续运行的热与能耗,以及不同量化敏感层的误差分析。既然标准编码和推理 benchmark 还在计划中,我会把这版理解成很有意思的工程进展,而不是已经证明全面胜出。 另一个值得关注的是发布流程:同时给 Core AI bundle 和 safetensors 权重导出,并提供更新检查脚本,说明维护者在考虑从下载、重建到升级的完整路径。后续若能把评测提示、设备与系统版本、采样设置和可复现脚本放齐,其他人就能判断差异来自量化算法、编译器还是运行环境;对端侧模型来说,这种透明度和最终跑分一样重要。等完整 benchmark 出来后,最好把速度、内存、质量与能耗放在同一张表里,才知道具体取舍换来了什么。
曝光 131 · 评论 2 · 点赞 2 · 书签 0