TwKit

推文

@fireandstart · 2026-10-11 14:09

这条论文介绍抓住了 AI 可靠性里一个容易被“答对率”遮住的问题:模型不仅要给答案,也要让人知道自己到底有多确定。文中举的例子很直观——模型实际只有六成把握,却用九成九的口气回答;在医疗场景里,这种错位可能让后续的人类判断也跟着偏航。 我觉得置信度校准的价值,不是让模型看起来更谦虚,而是让系统能据此选择合适的下一步:低风险、证据充分时直接回答;置信度不足或后果较重时,补充检索、提出澄清问题,或者交给人复核。否则,一个漂亮的概率数字也只是另一种界面装饰。 ConfTuner 用 Tokenized Brier Score 直接训练候选置信度分布,这个方向值得关注,因为它把“表达不确定性”放回预测本身,而不是事后贴标签。接下来真正要看的,是这种校准在分布变化、长尾病例和不同群体上是否仍然可靠,以及校准误差能否转化成更好的产品策略。对高风险应用来说,正确答案重要;知道何时不该自信,同样重要。

曝光 34 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 16.969373749676024

TwKit
正在载入