推文
@fireandstart · 2026-10-11 01:59
把 52 层压成两个共享块,参数从 2.04B 降到 153M,这个结果最值得讨论的不是“缩小 13 倍”本身,而是它把模型的容量放在了哪里:不再为每一层保存一套独立权重,而是让同一组模块在不同阶段反复处理表示。这样可以显著降低权重存储和分发成本,但每次循环仍要执行计算;帖子也特意澄清了这不是速度提升的宣称。 因此评估它时,至少要把三个问题拆开:模型文件、加载时的内存峰值是否真的下降;在相同硬件、精度和批量下,吞吐、延迟与能耗如何;以及 ASR 的字错率、口音、噪声、长音频等质量指标是否接近教师模型。约 12,000 小时英语语音蒸馏和 24/28 次循环说明了训练与推理路径,但还不能代替准确率和端到端基准。 如果质量差距很小、存储受限而算力充足,这种权重共享可能很有吸引力;若瓶颈是实时延迟或电池功耗,反复计算就需要单独核算。期待后续结果把模型大小、峰值内存、实时因子、延迟分位数和错误率放在同一张对照表里,也说明基线使用的解码设置与硬件。这样才能看清它真正改善的是部署门槛,还是整体推理成本。
曝光 60 · 评论 1 · 点赞 1 · 书签 0