论文
面向检索增强生成的并行专家上下文解码
Parallel Context-of-Experts Decoding for Retrieval Augmented Generation
摘要
检索增强生成面临权衡:把文档拼进长提示可支持多文档推理,却造成预填充瓶颈;而分别编码文档KV缓存虽然快速,却破坏跨文档交互。我们提出并行专家上下文解码(Parallel Context-of-Experts Decoding,Pced),一个免训练框架,把证据聚合从注意力机制转移到解码阶段。Pced把检索到的文档视为彼此隔离的“专家”,通过一种新颖的检索感知对比解码规则同步其预测,该规则以模型先验为参照权衡专家logits。这种方法无需构建跨文档共享注意力,即可恢复跨文档推理能力。