论文

LLM 能否对检索到的信息持保留态度?

Can LLMs Take Retrieved Information with a Grain of Salt?

模型评测模型能力评测

摘要

大语言模型 展示了令人印象深刻的检索增强功能。然而,一个关键领域仍未得到充分探索:它们根据检索到的信息的确定性适当调整响应的能力。这是一个限制,在医学和金融等高风险领域产生了实际后果。我们评估了 8 个 LLM 的上下文确定性服从情况,衡量他们调整响应以匹配所表达的上下文确定性的程度。我们的分析揭示了系统性局限性:LLM 在观察不确定的上下文后很难回忆起先验知识,误解了所表达的确定性,并过度信任复杂的上下文。为了解决这些问题,我们提出了一种结合预先提醒、确定性重新校准和上下文简化的交互策略。这种方法在不修改模型权重的情况下平均减少了 25% 的服从误差,证明了交互设计在增强 LLM 可靠性方面的功效。我们的贡献包括原则性的评估指标、对 LLM 不确定性处理的实证见解,以及提高不同 LLM 的上下文确定性服从的可移植策略。