论文
模型可以免费捕获自己的幻觉吗?:无标签的怀疑信号相对于有标签的弃权数据集保持不变
Can a Model Catch Its Own Hallucinations for Free?: Label-Free Doubt Signals Hold Their Own Against a Labelled Dataset for Abstention
摘要
大语言模型 陈述虚假事实和真实事实一样流利,但当模型的基础不稳定时,它通常会在内部“知道”:它分配给自己答案的概率往往会根据它出错的事实而下降。对此采取行动的通常方法是教模型放弃而不是猜测,需要一个包含正确和错误答案的标记数据集。我们询问模型自己的自信(它是免费的并且不需要标签)是否可以代替这项工作。我们对每个模型(使用 LoRA)进行微调,以在其冻结置信度较高时做出回答,并在其较低时表示“我不确定”,仅使用信号且不使用正确性标签。在关于简短事实问答的六个开放权重模型(1B-8B,两个系列)中,由独立法官模型判定正确性,这种无标签配方在标签监督弃权调整方面拥有自己的优势:在匹配覆盖率下,我们发现两者之间没有统计上可检测的差异。练习困难的例子而不是放弃的控制没有帮助,这表明增益来自校准,而不是死记硬背。该信号的一个盲点是明显错误的事实,它无法标记这一点。因此,在教授模型何时放弃时,模型自身的怀疑几乎可以替代标记的数据集。代码和工件可根据要求提供。