TwKit

推文

@kafkaup · 2026-10-08 18:54

📄 External Observers May See More Clearly: Cross-Model Span-Level Hallucination Detection in Large Language Models via Hidden State Probing 概述:该论文提出一种基于隐藏状态探测的跨度级幻觉检测框架,发现外部观察者模型在检测生成模型的幻觉起始点时,表现可匹配甚至超越生成模型的自我检测能力。 核心贡献:论文提出新颖的跨模型检测框架,证明外部观察者模型(即使规模更小)在定位另一模型的幻觉起始点上,其表现可匹配或超越该模型自身的检测能力。 实验结果:作者报告称,该隐藏状态探测方法在类别极度不平衡的情况下,其精确率—召回率曲线下面积相较随机基线有显著提升;在跨模型设置中,外部观察者模型(包括规模更小的模型)在检测幻觉起始点上可匹配或超越生成模型的自我检测,但摘要未给出具体数值。

曝光 161 · 评论 1 · 点赞 0 · 书签 0 · 曝光/时 13.36284197188315