论文
ConflictScore:识别和衡量语言模型如何处理冲突证据
ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence
摘要
现有的事实性指标和 忠实性 评估答案是否受到其证据文档的支持或矛盾,但当支持和矛盾的证据共存时,它们无法捕获。我们引入了 ConflictScore,这是一种新颖的指标,可以量化模型的响应在其基础文档中承认冲突证据的程度。我们的框架将响应分解为原子声明,根据每个基础文档标记每个声明,然后将这些标签聚合为两个互补的度量:冲突分数计数(CS-C),即表现出冲突的声明的比例,以及冲突分数比率(CS-R),即支持证据和反驳证据之间的平衡。我们开发了 ConflictBench,这是一个涵盖歧义、矛盾和意见分歧等多种形式的冲突的基准,以系统地评估我们的指标。实验表明,ConflictScore 可以有效检测跨领域的过度自信声明,并可以作为纠正反馈机制,提高 TruthfulQA 的真实性。