论文

Hindsight Hint Distillation:从无CoT答案为SWE智能体构建脚手架式推理

Hindsight Hint Distillation: Scaffolded Reasoning for SWE Agents from CoT-free Answers

摘要

解决复杂的长时程任务需要强大的规划与推理能力。尽管带有显式思维链(CoT)论证的数据集能显著促进学习,但其获取成本高昂。为应对这一挑战,我们提出Hindsight Hint Distillation(HHD),它只需要易于获取的问答对,无需CoT标注。受人类教师利用学生错误提供针对性指导的启发,HHD从模型自身失败的自采样中合成事后提示,并用它们为成功完成任务的策略内采样搭建脚手架。随后模型对这些脚手架轨迹进行自蒸馏,并在无提示引导的情况下泛化到新问题。实验表明,HHD显著优于迭代式RFT和轨迹合成基线,在SWE-bench Verified上取得8%的绝对提升,而所有基线仅提升约2%。值得注意的是,HHD诱导的推理策略能有效泛化到分布外任务,尽管未在多语言数据上训练,却在SWE-bench Multilingual上取得最大增益。这些结果表明,HHD能从无CoT数据中有效合成专家级推理,并显著提升长时程任务性能。

Hindsight Hint Distillation:从无CoT答案为SWE智能体构建脚手架式推理:论文配图
图 1:人类通过提示学习与死记硬背。有效的教师提供有针对性的提示,而不是直接答案,让学生内化解决策略,真正做到“一课懂多”。相比之下,仅仅依靠答案记忆会导致复杂场景下的失败。受提示学习范式的启发,我们提出后见之明提示蒸馏(HHD),使用合成轨迹进行自我改进,该轨迹由失败的自我推出的后见之明总结而成。