论文
回答了错误的问题:面向LLM弃答的推理轨迹反转
Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs
摘要
要可靠地部署大语言模型(LLM),模型必须有效地知道何时不作答,即弃答。推理模型尤其因在复杂任务上的出色表现而备受关注。然而,已有研究表明推理模型的弃答能力更差。考虑到推理模型的脆弱性,我们提出查询错位框架(Query Misalignment Framework)。导致弃答失败的幻觉可被重新解读为LLM在回答错误的问题(而非把问题答错)。基于该框架,我们开发出一类新的最先进弃答方法,称为Trace Inversion。首先,我们生成模型的推理轨迹。然后,仅依据该轨迹重建模型最可能回应的查询。最后,我们将初始查询与重建的查询进行比较。初始查询与重建查询之间相似度分数低,表明模型很可能答错了问题,从而被标记为应弃答。大量实验表明,Trace Inversion在四个前沿LLM和九个弃答QA数据集上有效提升弃答性能,在36个设置中的33个击败有竞争力的基线。
