论文
使用代码解释器探索外在和内在属性以进行有效推理
Exploring Extrinsic and Intrinsic Properties for Effective Reasoning with Code Interpreter
摘要
代码解释器推理(CI)已成为通过可执行计算和迭代验证增强 大语言模型(LLM)推理能力的有效范例。尽管它的采用率越来越高,但有效代码推理背后的行为属性在很大程度上仍未得到充分探索。在这项工作中,我们从先前对自然语言推理的研究的启发,从两个不同的角度研究代码推理:由关键标记表示的外在属性和由特定于代码的认知行为表示的内在属性。在多个 LLM 中,我们发现更强的 CI 推理模型始终表现出更高的关键标记和认知行为的普遍性,特别是验证、回溯和向后链接。基于这些观察,我们研究了如何在推理和训练过程中利用这些属性。在推理时,附加特定于代码的关键标记可以提高多种推理功能的性能,包括数学、排序和优化,但在其他方面产生的好处有限。在训练时,通过特定于代码的认知行为增强最先进的框架可以提高三个评估模型中两个模型的监督 微调 和强化学习性能。进一步的分析表明,这些行为减少了错误响应中的过度思考,提高了词元效率,同时也揭示了限制特定模型收益的因素。我们的研究结果首次系统地描述了 CI 的有效推理,并证明了利用关键属性来改进基于 CI 的推理的潜力和局限性。