论文
可见推理不是通用优化器:分析代码生成中角色和思维相关的影响
Visible Reasoning Is Not a Universal Optimizer: Persona- and Thinking-Dependent Effects in Analytics Code Generation
摘要
可见思维链 (CoT) 通常被视为一种广泛有用的推理指令,但分析代码生成结合了自然语言歧义、模式基础、目标语言约束和特定于模型的推理行为。因为相同的分析请求可以用两种不同的目标语言(SQL 和 Python(pandas))表达,所以此设置提供了对常见但未经充分检验的假设的自然测试:当其表示与请求的目标匹配时,可见推理会更有效,如“用 SQL 思考”或“用 Python 思考”。与“逐步思考”等通用指令一起,在受控的、基于执行的比较下,此类建议仍然没有得到充分的评估。我们研究了一个查询匹配的 SQL-pandas 基准测试,该基准测试跨越角色短语、目标语言、可见 CoT 格式、控制前缀、直接生成和内部推理配置。结果既不支持可见 CoT 的普遍准确性优势,也不支持将推理表示与目标语言匹配所带来的一致优势。 相反,效果取决于角色、目标、模型配置和内部推理设置。控制消融进一步区分推理内容的效果和提示格式的效果。这些发现表明,推理策略应该针对模型、角色、目标和内部推理配置共同选择,而不是采用通用默认值。更广泛地说,该研究提供了一个受控框架,用于识别可见推理何时改善可执行文件的生成、何时主要扰乱模型行为以及何时内部推理配置是更重要的因素。