论文

RLM:通过递归调用处理超长上下文

Recursive Language Models

上下文与知识上下文工程

摘要

本文从推理时计算扩展的角度研究如何让大语言模型处理任意长提示,提出递归语言模型(RLM)这一通用推理策略。RLM把长提示视为外部环境的一部分,使LLM能够通过程序检查、分解提示,并针对其中的片段递归调用自身。实验发现,RLM能处理最长达到模型上下文窗口两个数量级之外的输入;即使提示较短,在四项不同的长上下文任务中,RLM的质量也显著优于基础LLM及常见长上下文脚手架,同时每次查询成本相当或更低。

RLM:通过递归调用处理超长上下文 配图
图5:GPT-5及第2.2节所述方法在OOLONG、OOLONG-Pairs、CodeQA和BrowseComp+(1K)中的运行时间分位数:第25、50、75和95百分位。