论文
代码比语言更适合算法推理吗
Is Code Better Than Language for Algorithmic Reasoning
摘要
对于工具增强语言模型,将自然语言推理与代码执行管道进行比较很困难,因为比较会改变中间表示和执行机制。我们通过中间干预将这些因素分开:模型将其推理表达为可执行代码,语言模型在上下文中模拟该代码以产生答案。在 40 项可验证的算法基准测试中,确定性代码执行的性能比自然语言推理高出 31.6 个百分点。我们观察到中间干预与自然语言推理没有显着差异(+0.15pp)。这些结果表明,在我们评估的环境中,仅更改中间表示并不能解释工具使用优势,从而为需要可靠的外部执行的性能增益提供了证据。我们用一个简单的统计决策理论模型来形式化这种直觉,该模型描述了在我们解开的跟踪生成/执行机制中执行何时主导端到端风险。我们使用重建干预来验证我们的理论,该重建干预利用代理语言模型从代码表示中推断自然语言推理轨迹,恢复与原始自然语言推理管道相当的性能。所有实验均位于 https://github.com/TerryTong-Git/ToolProj。