论文
Hindsight Hint Distillation:从无CoT答案为SWE智能体构建脚手架式推理
Hindsight Hint Distillation: Scaffolded Reasoning for SWE Agents from CoT-free Answers
摘要
解决复杂的长时程任务需要强大的规划与推理能力。尽管带有显式思维链(CoT)论证的数据集能显著促进学习,但其获取成本高昂。为应对这一挑战,我们提出Hindsight Hint Distillation(HHD),它只需要易于获取的问答对,无需CoT标注。受人类教师利用学生错误提供针对性指导的启发,HHD从模型自身失败的自采样中合成事后提示,并用它们为成功完成任务的策略内采样搭建脚手架。随后模型对这些脚手架轨迹进行自蒸馏,并在无提示引导的情况下泛化到新问题。实验表明,HHD显著优于迭代式RFT和轨迹合成基线,在SWE-bench Verified上取得8%的绝对提升,而所有基线仅提升约2%。值得注意的是,HHD诱导的推理策略能有效泛化到分布外任务,尽管未在多语言数据上训练,却在SWE-bench Multilingual上取得最大增益。这些结果表明,HHD能从无CoT数据中有效合成专家级推理,并显著提升长时程任务性能。
