论文
超越多数票:医学幻觉检测的多视角裁决
Beyond Majority Vote: Multi-Perspective Adjudication for Medical Hallucination Detection
摘要
了解聊天机器人生成的文本中事实错误的频率并评估检测这些错误的系统对于确定聊天机器人的安全性至关重要。然而事实错误检测通常被视为单通道、单注释器标记问题。在长篇聊天机器人响应中,事实错误可能很微妙,并嵌入在大部分正确的文本中。我们开发了医学相关聊天机器人响应的多视角注释研究,结合了首次注释、LLM-as-a-Judge (LaJ) 候选者发现以及两种形式的裁决:医学专家和基于证据的事实检查。首次通过的注释者经常会错过后来由评审者验证的事实错误。 LaJ 改进了候选发现,但其本身还不够:它错过了注释器捕获的事实错误。我们还发现评审者之间存在分歧,这表明对多个候选来源的评审可以提高基准的完整性,但并不能消除应用判断和专业知识的需要。应用于现有基准测试时,该技术揭示了类似的缺失注释模式。总之,这些结果表明,在此处检查的设置中,单次幻觉基准可能会以低估事实错误为代价实现规模化。多遍裁决可以提高覆盖率,但从基准中得出的推论仍然对用于确定错误存在的判断、专业知识和证据敏感。