论文
UNREAL:在冻结模型内部统一检索与长上下文
UNREAL: Unifying Retrieval and Long-Context with a Single Model
摘要
长上下文推理与RAG在从单个长提示到整个语料的不同尺度选择证据。我们问同一模型内部机制能否跨尺度工作,提出UNREAL,以模型原生证据选择统一语料检索与长上下文。它直接从冻结LLM内部表征编码块并生成检索查询,新增不足500K可训练参数,骨干不变。在30亿词元、2100万块Wikipedia索引上,四个稠密或混合骨干均超过先进检索—重排系统。最佳模型在HotpotQA召回从49.1%到73.2%,2WikiMultiHopQA从31.7%到60.1%,MuSiQue从8.8%到14.4%。相同机制在生成前移除长上下文干扰,在NoLiMa最大128K词元长度准确率从1.0%到24.83%,LV-Eval 256K的F1从49.97%到54.66%。约32K词元起,相比全上下文推理降低FLOPs和首词元时间,长度增加时收益更大。结果建立内部证据选择作为大语料和稀疏证据长输入的共同基础。
