论文

回答了错误的问题:面向LLM弃答的推理轨迹反转

Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs

模型推理推理验证与自校正

摘要

要可靠地部署大语言模型(LLM),模型必须有效地知道何时不作答,即弃答。推理模型尤其因在复杂任务上的出色表现而备受关注。然而,已有研究表明推理模型的弃答能力更差。考虑到推理模型的脆弱性,我们提出查询错位框架(Query Misalignment Framework)。导致弃答失败的幻觉可被重新解读为LLM在回答错误的问题(而非把问题答错)。基于该框架,我们开发出一类新的最先进弃答方法,称为Trace Inversion。首先,我们生成模型的推理轨迹。然后,仅依据该轨迹重建模型最可能回应的查询。最后,我们将初始查询与重建的查询进行比较。初始查询与重建查询之间相似度分数低,表明模型很可能答错了问题,从而被标记为应弃答。大量实验表明,Trace Inversion在四个前沿LLM和九个弃答QA数据集上有效提升弃答性能,在36个设置中的33个击败有竞争力的基线。

回答了错误的问题:面向LLM弃答的推理轨迹反转:论文配图
图1:推理模型中已有拒答方法表现不佳,本文通过推理轨迹反转改进LLM拒答决策。