论文
经测试时重构闭合潜空间推理的回路
Closing the Loop on Latent Reasoning via Test-Time Reconstruction
摘要
最近的工作将中间推理从自然语言跟踪转移到潜在或缓存级表示中,以减少令牌开销并避免离散通信瓶颈。然而,这种转变也消除了文本推理的一个关键优势:中间状态不再是可检查的,因此很难确定潜在状态是否仍然保留原始查询的约束。因此,潜在推理通常在开环中运行,其中在没有输入锚定保真度检查的情况下产生和消耗潜在状态。我们提出了 ReLAT(测试时重建引导的潜在推理),这是一种自监督的测试时训练方法,它使用查询本身作为参考来关闭此循环。我们的关键观察是,如果潜在状态忠实地表示查询,则查询应该可以从中恢复;如果查询无法恢复,则潜在状态已丢失任务相关信息。 ReLAT 通过构建可微分的问题 -> 潜在思想 -> 问题循环并通过答案生成之前的潜在思想优化查询重建损失来操作这一原则。这将不透明的潜在计算锚定到它应该表示的问题规范。在 Qwen 系列的数学推理、知识 QA 和代码生成基准测试中,ReLAT 不断改进单模型推理、基于文本的协作、开环潜在协作和替代测试时训练目标。在 Qwen3-8B 上,ReLAT 将 AIME 2024 准确率从 56.7% 提高到 73.3%,比最强的开环潜在基线提高了 16.6 个点。
