论文
CoT训练的收益落在LLM智能体的哪里?
Where Do CoT Training Gains Land in LLM based Agents?
摘要
思维链(CoT)推理广泛用于语言模型智能体——但先前工作表明言语化CoT不总是忠实的——可能反映事后推理——即模型在推理前已知答案。因此我们追问CoT训练实际在改进什么:模型是变得更善于经生成推理改变动作——还是变得更善于直接从提示预测动作?我们经比较提示动作(无CoT预测动作)与CoT动作(带CoT预测动作)研究该问题。跨检查点——提示动作质量大幅改善。与环境交互时——CoT动作相对提示动作的相对优势保持相似——表明CoT训练不扩大CoT推理的优势——而是帮助改进提示动作的质量。我们进一步发现更晚的检查点更少响应CoT而修改动作——提示对提示的更大依赖。受这些模式启发——我们在一部分训练示例上选择性遮蔽动作token监督。该干预改进域外泛化。
