论文
PFaithBench:成对上下文下重新评测语言模型忠实性
Rethinking Faithfulness in LLMs: A Pairwise Context-Sensitive Perspective
摘要
大语言模型(LLM)应根据所提供的上下文忠实地回答问题,当上下文信息不足以回答问题时弃权。现有的忠诚度评估通常单独评估每个问题上下文实例;然而,这种实例级评估未能捕获忠实行为的基本要求:使模型响应适应可用上下文变化的能力。特别是,当存在足够的证据时,模型应该提供正确的答案,而当证据不足时,模型应该放弃。在这项工作中,我们提出了一个配对忠诚基准(PFaithBench),用于评估模型是否可以在支持和不支持的上下文中对同一问题在回答和弃权之间切换。我们对七个模型系列的 39 个模型的评估表明,忠诚度从根本上涉及回答和弃权之间的权衡,并且大多数当前模型对回答表现出强烈的偏见,大多数忠诚度错误源于过度回答,即即使提供的上下文不充分,模型也倾向于编造响应。我们进一步对不同数据结构下的忠实度训练进行了一系列研究。我们的结果表明,训练结果对回答和弃权数据的具体组成高度敏感。从不匹配的来源构建回答和放弃数据可能会导致模型依赖于数据集特定的快捷方式,而不是实际的上下文充足性。此外,增加回答监督数据可以提高回答性能,但会加剧过度回答,而增加弃权数据可以减少幻觉,但会导致过度弃权。代码和数据发布于https://github.com/tmlr-group/PFaithBench.
