论文

ThinkReset:构建可学习中间接口以支持有限上下文长程推理

ThinkReset: Learnable Intermediate Interface Construction for Bounded-Context Long-Horizon Reasoning

上下文与知识上下文工程

摘要

长链思维推理在解决复杂问题时提高了性能,但同时也引入了冗余累积、上下文溢出和错误锚定等问题。我们提出,受限上下文窗口下,核心瓶颈不是轨迹压缩或测试时间控制,而是缺乏一个可以替换丢弃历史并支持继续解决的可复用中间接口。我们进一步识别了结果奖励驱动的长链强化学习中的关键失败模式:当模型在窗口即将耗尽时仍未解决任务,最终答案奖励鼓励提前猜测而非继续谨慎推理。我们提出ThinkReset,这是一种基于此观点的文本空间实例化。ThinkReset通过接口写回和重置直接构建可复用中间接口,并直接优化重置后的继续成功率。在多个长序列推理基准上,这一视角在固定上下文窗口下持续提高成功率。