论文
REPOT:通过检查点修复可恢复的思想计划
REPOT: Recoverable Program-of-Thought via Checkpoint Repair
摘要
一次性思维计划 (PoT) 发出一个 Python 程序,打印一个原始行动计划;单个无效动作会默默地使轨迹失效。我们引入了 RePoT(可恢复 PoT):一种确定性的验证重放,它使计划在环境中运行到第一个无效转换,然后是一个从验证的前缀恢复的 LLM 调用。对于 PoT 失败的约 14% 的问题,RePoT 至多需要一次额外的 LLM 调用。在 PuzzleZoo-775 上的四种封闭模型配置中,RePoT 比 PoT 领先 +3 至 +11 个百分点,峰值为 96.9%,而在 gpt-5.4-minimedium 上则为 86.3%;与匹配预算 PoT 重试基线相比,RePoT 在 Gemini 上取得了决定性的胜利(+3.8pp,95% CI [+2.2,+5.4]),在 GPT-medium 和 Claude 上处于采样噪声范围内,并在 GPT-mini 上失败——我们开始使用自适应 RePoT 来解决这种能力扩展模式,自适应 RePoT 是一种基于规则的调度程序,可根据验证的前缀长度在后缀修复和新的 PoT 重试之间进行路由(初步)。我们在 PlanBench Blocksworld(+1.1 至 +11.4pp)和四个开放权重模型(四个中的三个上+3.3 至 +20.0pp)上进行复制。在我们的受控恢复基准 Derail-550 上,每个能够访问检查点信息的条件在 GPT-medium 上清除 >=30%,在 Gemini 上清除 >=70%,而对于仅错误反馈,则清除 <=3.1%——这表明检查点信息,而不是特定的已验证前缀尾部,是承载恢复信号。