论文

Plan Canvas:连续语言流中的固定推理区域

Plan Canvas: Fixed Reasoning Regions for Continuous Language Flows

模型推理推理策略与问题分解

摘要

连续语言流通过对目标画布的所有位置进行去噪来生成文本。向此类模型添加推理的自然方法是在答案之前编写跟踪,但跟踪长度会因问题而异。因此,在去噪过程中,答案开始是未知的,模型必须同时决定迹线长度、每条迹线 token 的位置以及答案。我们提出 Plan Canvas 来修复轨迹和答案之间的边界。固定容量的计划区域包含紧凑的迹线,监督填充填充其未使用的位置,并且答案从固定位置开始。固定区域还允许针对计划和答案使用单独的降噪时钟。在跟踪文本、骨干模型 和自由跟踪基线的画布长度保持固定的情况下,Plan Canvas 提高了 ProsQA 和 Deep ProsQA(具有更长证明的图形基准)的准确性。在 Deep ProsQA 上,准确率从 73.0\% 上升到 87.0\%,用有效路径回答的问题比例从 30.8\% 上升到 59.1\%,并且在最长的证明上增益最大。