论文
LeAct:从专家行动中学习推理
LeAct: Learning to Reason from Expert Actions
摘要
现代推理模型依赖于推理数据,如今这些数据源自人类注释或从更强大的 LLM 中提取。然而,专家系统(例如游戏引擎、经典规划器、定理证明器)中有丰富且很大程度上尚未开发的监督来源,它们通常会在不同领域产生接近最优的动作。但这些专家保持沉默:他们承诺采取行动,但没有写下其背后的思想链(CoT)。将 CoT 恢复为自然语言推理,可以将专业知识提炼给学生,使学生能够概括超出所展示的行动。我们将其视为潜在变量,并研究如何仅从动作中恢复它。我们的方法 LeAct(从动作中学习推理)优化了这个潜在变量:学生为每个专家动作采样候选 CoT,并且我们保留那些可显着提高其恢复动作概率的那些 CoT。在多个尺度的不完美信息游戏和模拟机器人基准中,LeAct 在小型可枚举游戏上达到了求解器的数值下限。在更大的规模上,它比最强的专家迭代基线更接近求解器 5 倍。在翻牌德州扑克($\sim 10^9$ 信息集)中,LeAct 以 $+60$ mbb/g 的优势赢得了正面对决,并且在机器人探测中,它是唯一可以改进直接模仿的训练方法。我们提出了一个原则框架和结果:专家系统成为基础模型推理教师的全新来源。