TwKit

推文

@kafkaup · 2026-10-09 03:28

📄 Paradee: Distilling Kokoro-82M into an 8M-Parameter Single-Voice Text-to-Speech Model 概述:作者将拥有54种声音的8200万参数开源语音合成模型Kokoro蒸馏为仅807万参数的单一音色模型Paradee,参数减少10倍、算力需求降低15倍,在CPU单线程上运行速度为实时的25倍,同时保持接近教师模型的语音质量。 核心贡献:该研究提出了一种无需对齐学习与联合训练的蒸馏流程,将文本侧与解码器两部分分别针对冻结教师模型单独训练,最终得到仅8.5MB、int8量化且可在笔记本电脑单CPU线程上以25倍实时速度运行的单音色语音合成模型。 实验结果:论文报告称Paradee参数量减少10倍、算力需求降低15倍,int8量化后仅8.5MB,单CPU线程推理速度为实时的25倍,UTMOS评分为4.41(教师模型为4.52);一种无需训练、不增加参数的相位锁定滤波器可在合成后消除大部分由2至8kHz浊音相位引起的嗡鸣噪声。

曝光 57 · 评论 1 · 点赞 0 · 书签 0