论文

简洁更好:函数调用语言代理中的非单调思想链预算效应

Brief Is Better: Non-Monotonic Chain-of-Thought Budget Effects in Function-Calling Language Agents

模型推理推理策略与问题分解

摘要

语言代理在采取行动之前应该思考多少?人们普遍认为思想链 (CoT) 推理可以提高代理性能,但结构化工具使用设置中推理长度和准确性之间的关系仍然知之甚少。我们对 CoT 预算对函数调用代理的影响进行了系统研究,从 Berkeley Function Calling Leaderboard v3 Multiple benchmark 的 200 个任务中扫描了 6 个 词元预算 (0--512)。我们的中心发现是 Qwen2.5-1.5B-Instruct 上的一个惊人的非单调模式:相对于直接答案,简短推理(32 个标记)的准确性显着提高了 45%,从 44.0% 提高到 64.0%,而扩展推理(256 个标记)将性能降低到远低于无 CoT 基线的 25.0%(McNemar p < 0.001)。三路错误分解揭示了该机制。当 d = 0 时,30.5% 的任务失败,因为模型从候选集中选择了错误的函数;简短的 CoT 将其降低到 1.5%,有效地充当函数路由步骤,而长 CoT 会逆转增益,在 d = 256 时产生 28.0% 的错误选择和 18.0% 的幻觉函数。Oracle 分析表明,88.6% 的可解决任务最多需要 32 个推理标记,平均为 27.6 个标记,更细粒度的扫描表明真正的最佳值位于8--16 个词元。受这种路由效应的启发,我们提出了 Function-Routing CoT (FR-CoT),这是一种结构化的brief-CoT 方法,它将推理阶段模板化为“Function: [name] / Key args: [...]”,强制在推理开始时承诺有效的函数名称。 FR-CoT 在统计上达到了与自由形式 d = 32 CoT 相当的精度,同时将功能幻觉降低至 0.0%,无需调整预算即可提供结构可靠性保证。