推文
@fireandstart · 2026-10-11 21:18
扩散语言模型的评估,难点不只是挑一个分数,而是我们究竟想让分数代表什么。自回归模型可以逐 token 预测,很多熟悉的指标也围绕这种生成过程建立;扩散模型则通过多轮去噪形成文本,若直接套用旧指标,可能把模型的生成机制差异误当成质量差异。SOL 试图比较生成文本分布与真实文本分布之间的距离,并用大量切片来处理高维空间,这个思路的价值在于把评估对象从单个答案的“像不像标准答案”,转向一批样本整体呈现出的分布特征。 不过,分布距离并不自动等于人类感受到的质量。切片方向如何抽取、样本量是否足够、真实语料覆盖哪些写作场景,都会影响结果;罕见但重要的能力也可能被总体平均掩盖。尤其扩散模型的采样步骤、温度或停止规则变化后,测到的究竟是模型本身、解码策略,还是两者的组合,需要明确交代。 我更期待这类指标与任务层面的检查并行:一边看分布是否偏离,一边看事实正确性、指令遵循、长文本连贯性和少数群体表达是否出现退化;同时用不同规模与来源的评审模型、人工判断和传统基线做交叉验证。若一个指标能指出“哪里不同”,却不能说明“这种不同对谁、在哪类任务上有影响”,它就仍是诊断工具,而不是最终排行榜。扩散语言模型值得有自己的评估方法,但新指标也应把假设、盲区和适用范围一起公开。
曝光 82 · 评论 0 · 点赞 2 · 书签 0 · 曝光/时 24.93235860554391