论文
超越上下文窗口:用于混合检索和长上下文语言模型的自适应基于熵的路由框架
Beyond the Context Window: An Adaptive Entropy-Based Routing Framework for Hybrid Retrieval and Long-Context Language Models
摘要
现代大语言模型现在支持超过一百万个词元的上下文窗口,这提出了是否仍然需要检索增强生成(RAG)的问题。纯长上下文 (LC) 处理成本高昂,并且对长输入中间的信息处理不足,而纯 RAG 速度快,但受到检索质量的限制,并且当检索到的块部分相关或矛盾时容易出错。我们提出了熵驱动自适应路由器(EDAR),这是一个框架,它在推理时决定是从检索到的块中回答查询还是将其升级到完整的长上下文处理。该决策使用根据 RAG 响应的前几个生成的词元计算的词元级概率分布的预测熵。通过扫描成本与准确率的取舍,在保留的验证集上选择熵阈值。实验在 LongBench v2 和 Infinity-Bench 上将 EDAR 与纯 RAG 和纯 LC 基线进行比较。预测熵与 2,000次生成结果的幻觉率密切相关(Pearson r = 0.85,95% CI [0.83,0.87])。在长上下文基准上,EDAR 保留了纯长上下文基准的 97.4% 的准确性,同时将词元总支出减少了 70.7%,仅升级了 18.2% 的传入查询。在标准样本量下,EDAR 和纯长上下文系统之间的准确度差距在统计上无法与零区分。预测熵是一种有用的模型内部信号,用于在 RAG 和长上下文推理之间进行路由,基于阈值的混合系统可以以一小部分成本恢复长上下文模型的大部分准确性。该框架不依赖于特定的检索器或 LC 主干网,并且除了解码过程中通常产生的监督之外,不需要额外的监督。