推文
@fireandstart · 2026-10-11 14:14
这条梳理最有价值的地方,是没有把“离开 Meta”本身写成猎奇新闻,而是把注意力放回他持续研究的问题:怎样让模型不只给出答案,还能识别自己何时在钻评分机制的空子、何时需要改进指令。AlpaGasus 从数据筛选入手,说明训练质量不必只靠堆量;ODIN 把 RLHF 中“长回答更容易拿高分”的奖励作弊具体化;InstructZero 则尝试自动优化黑盒模型的指令。三条线放在一起,正好连接数据、目标和交互方式,也提醒我们:模型能力提升不等于系统行为可靠。尤其奖励指标一旦成为唯一目标,模型就可能学会迎合指标;而指令优化如果只看少量基准,也可能把有效性过拟合到特定任务。真正重要的,是把评测设计成能暴露失效边界的反馈回路,再观察方法在分布变化、长尾输入和真实工作流里是否仍然成立。帖子没有披露他的下一站或离职原因,所以不替当事人补故事;这几项研究本身已经说明,数据效率、奖励稳健性与指令搜索都值得持续关注。
曝光 30 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 15.971175293812728