论文
FRESCO:检索增强生成中不断演变的语义冲突的基准测试和优化重排序器
FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation
摘要
检索增强生成 (RAG) 是通过将响应基于最新证据来缓解 大语言模型 (LLM) 的时间陈旧性的关键方法。在 RAG 管道中,重新排序器在从检索到的候选文档中选择最有用的文档方面发挥着关键作用。然而,现有的基准主要评估静态设置中的重新排序器,并且不能充分评估不断变化的信息下的性能——这是一个关键差距,因为现实世界的系统通常必须在时间上不同的证据中进行选择。为了解决这个限制,我们引入了 FRESCO(事实新近度和演化语义冲突),这是一个在时间动态上下文中评估重排序器的基准。通过将近期搜索查询与历史维基百科修订配对,FRESCO 测试重新排序者是否可以优先考虑最近的事实证据,同时保持语义相关性。我们的评估揭示了现有重新排序器的一致失败模式:对旧的、语义丰富的文档有强烈的偏见,即使它们实际上已经过时了。我们进一步研究指令优化框架来缓解这个问题。通过识别平衡进化知识任务和非进化知识任务的帕累托最优指令,我们在进化知识任务上获得高达 27% 的增益,同时保持在非进化知识任务上的竞争性能。