论文
知道何时退出:诊断和训练 LLM 以中止无用的推理
Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning
摘要
大语言模型 对超出能力的任务生成计算成本昂贵但语义上无效的推理,从而产生听起来合理但不正确的推导误导用户的风险。我们通过系统分析来描述这种\textit{无用推理}现象,揭示了普遍的能力过度扩张以及能力与行为之间的系统性错误校准。主要的失败模式是似是而非的推理,其输出表面上看起来有效,但包含微妙的错误,并随着任务难度的增加而升级。为了解决这个问题,我们引入了 \textbf{CaRL} (\textbf{Ca}pability-\textbf{a}ligned \textbf{R}einforcement \textbf{L}earning),它通过奖励塑造来将模型行为与能力边界对齐,奖励塑造激励拒绝无效推理和事后拒绝增强,将失败转化为拒绝监督。实验表明,在保持跨任务困难的性能的同时,大幅减少了无用的推理,从而在不牺牲效用的情况下有效地实现了与能力一致的行为。 \footnote{https://github.com/icip-cas/Knowing-When-to-Quit}