论文

UNREAL:在冻结模型内部统一检索与长上下文

UNREAL: Unifying Retrieval and Long-Context with a Single Model

上下文与知识检索增强

摘要

长上下文推理与RAG在从单个长提示到整个语料的不同尺度选择证据。我们问同一模型内部机制能否跨尺度工作,提出UNREAL,以模型原生证据选择统一语料检索与长上下文。它直接从冻结LLM内部表征编码块并生成检索查询,新增不足500K可训练参数,骨干不变。在30亿词元、2100万块Wikipedia索引上,四个稠密或混合骨干均超过先进检索—重排系统。最佳模型在HotpotQA召回从49.1%到73.2%,2WikiMultiHopQA从31.7%到60.1%,MuSiQue从8.8%到14.4%。相同机制在生成前移除长上下文干扰,在NoLiMa最大128K词元长度准确率从1.0%到24.83%,LV-Eval 256K的F1从49.97%到54.66%。约32K词元起,相比全上下文推理降低FLOPs和首词元时间,长度增加时收益更大。结果建立内部证据选择作为大语料和稀疏证据长输入的共同基础。

UNREAL:在冻结模型内部统一检索与长上下文:论文原图
图2:UNREAL训练检索词元 $\rho$ 与求和权重 $\alpha$(火焰符号表示训练),保持LLM冻结,增强相关信息识别。训练变量从长上下文选择相关块,再交同一个LLM进行检索增强生成;数字表示操作顺序。