论文

BERAG:基于知识的视觉问答的贝叶斯集成检索增强生成

BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

上下文与知识检索增强

摘要

使用检索增强生成 (RAG) 进行问答的常见方法是将文档连接到单个上下文中,并将其传递给语言模型以生成答案。虽然简单,但这种策略可能会掩盖单个文档的贡献,使归因变得困难,并导致“迷失在中间”效应,即忽略长上下文中的相关信息。连接的扩展性也很差:计算成本随着上下文长度呈二次方增长,当上下文包含视觉数据时,这个问题变得尤其严重,就像在视觉问答中一样。通过限制上下文长度来缓解这些问题的尝试可能会阻止模型受益于更深层次检索所提供的改进的召回率,从而进一步限制性能。我们提出贝叶斯集成检索增强生成(BERAG)以及贝叶斯集成 微调(BEFT)作为 RAG 框架,其中语言模型以单个检索文档而不是单个组合上下文为条件。 BERAG 将文档后验概率视为整体权重,并在生成过程中使用贝叶斯规则逐个更新它们。这种方法可以实现概率重新排序、并行内存使用以及文档贡献的清晰归属,使其非常适合大型文档集合。我们主要在基于知识的视觉问答任务上评估 BERAG 和 BEFT,其中模型必须对长且不完美的检索列表进行推理。结果显示,与标准 RAG 相比有了显着改进,包括在文档视觉问答和多模式大海捞针基准测试方面取得了巨大进步。我们还证明 BERAG 减轻了“中间迷失”效应。文档后验可用于检测证据支持不足和触发转交处理,而文档修剪可实现比标准 RAG 更快的解码。