论文
用于一般符号推理的递归视觉语言模型
Recursive Vision Language Models for General Symbolic Reasoning
摘要
数独、迷宫寻路和 ARC 等硬符号推理任务对于 LLM 来说仍然具有挑战性,因为它们的固定深度自回归推理限制了系统搜索、细化和回溯。虽然层次推理模型 (HRM) 和微型递归模型 (TRM) 等递归模型通过迭代潜在状态细化解决了这一限制,但它们通常是特定于任务的,并且不利用预先训练的语言先验。我们提出了 R-Qwen,这是一个基于预训练的 Qwen 主干的递归推理框架。 R-Qwen 通过程序化自递归和深度监督,将递归模型的结构化迭代计算与预训练 LLM 的语言和推理先验相结合,反复细化候选解决方案。我们通过跨递归步骤对损失进行指数加权,进一步将分层监督权重(HSW)应用于自回归模型。 HSW 减少了至少 50% 的梯度方差,提高了随机梯度的信噪比,加速了收敛。在八个具有挑战性的基准测试中,R-Qwen 在使用相当数量的可训练参数的同时,始终优于先前的递归推理模型和更大的 LLM。值得注意的是,在 ARC-AGI 数据集上,我们的模型比基线提高了 27.6%,凸显了递归细化对于一般符号推理的有效性。这些结果表明,递归推理机制和预训练语言模型先验是改进符号谜题解决的互补方法。代码和模型将在验收后发布。