论文

多轮推理的自适应停止 LLM

Adaptive Stopping for Multi-Turn LLM Reasoning

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越依赖多轮推理和交互,例如自适应检索增强生成 (RAG) 和 ReAct 式代理来回答难题。这些方法通过迭代地检索信息、推理或行动来提高准确性,但引入了一个关键挑战:\textbf{模型何时应该停止?}现有方法依赖于启发式停止规则或固定回合预算,并且不提供最终预测仍然包含正确答案的正式保证。这种限制在金融和医疗保健等高风险领域尤其成问题,这些领域不必要的转向会增加成本和延迟,而过早停止则可能会带来错误决策的风险。共形预测(CP)提供了正式的覆盖保证,但现有的 LLM-CP 方法仅适用于单个模型输出,无法处理具有自适应停止的多匝管道。为了解决这一差距,我们提出了具有保形预测的多轮语言模型(MiCP),这是第一个用于多轮推理的 CP 框架。 MiCP 跨轮分配不同的错误预算,使模型能够提前停止,同时保持总体覆盖率保证。我们在自适应 RAG 和 ReAct 上演示了 MiCP,它在单跳和多跳问答基准上实现了目标覆盖,同时减少了轮数、推理成本和预测集大小。我们进一步引入了一个新的指标,联合评估覆盖范围的有效性和回答效率。