论文

CoT训练的收益落在LLM智能体的哪里?

Where Do CoT Training Gains Land in LLM based Agents?

模型评测模型行为与机制分析

摘要

思维链(CoT)推理广泛用于语言模型智能体——但先前工作表明言语化CoT不总是忠实的——可能反映事后推理——即模型在推理前已知答案。因此我们追问CoT训练实际在改进什么:模型是变得更善于经生成推理改变动作——还是变得更善于直接从提示预测动作?我们经比较提示动作(无CoT预测动作)与CoT动作(带CoT预测动作)研究该问题。跨检查点——提示动作质量大幅改善。与环境交互时——CoT动作相对提示动作的相对优势保持相似——表明CoT训练不扩大CoT推理的优势——而是帮助改进提示动作的质量。我们进一步发现更晚的检查点更少响应CoT而修改动作——提示对提示的更大依赖。受这些模式启发——我们在一部分训练示例上选择性遮蔽动作token监督。该干预改进域外泛化。

CoT训练的收益落在LLM智能体的哪里?:论文配图
图 5:动作预测期间的提示注意力与 CoT 注意力。左:跨环境分配给提示和 CoT 标记的总注意力。右图:来自提示标记的关注度最高的 KK% 位置的比例。两种观点都表明,提示标记主导着行动时间注意力。我们平均关注所有层级和负责人。