论文
何时进行深入思考:LLM 推理的抑制性深思熟虑
When to Think Deeply: Inhibitory Deliberation for LLM Reasoning
摘要
推理 大语言模型 可以通过深思熟虑的推理来提高解决问题的性能,但对每个输入调用缓慢的推理在计算上是昂贵的,而且通常是不必要的。我们提出 IDPR,一个响应条件抑制审议的框架。 IDPR 首先生成一个简洁直观的答案,然后使用抑制控制器来决定是否应该释放或抑制该特定响应以支持缓慢推理。与仅输入路由器不同,抑制控制器以快速答案和快速证据为条件,包括置信度、logits 裕度、可解析性和生成成本。我们从配对的快慢结果中训练控制器,并在精度优先的慢调用预算下选择保留验证集的抑制阈值。在包含 5,000 个示例的数学推理测试集上,IDPR 仅对 8.20% 的示例调用慢速推理,并将准确性从 47.90% 提高到 48.92%。在相同的慢速呼叫预算下,随机路由将准确率降低至 46.76%,而基于最强置信度的基线达到 48.22%。 IDPR 还实现了最高的纠正精度,表明反应条件抑制可以更好地识别受益于慢速推理的快速答案。