论文

别让我问:LLM 显示用于溯因推理的主动多轮信息获取的缺陷

Don't Let Me Ask for It: LLMs Show Deficiencies in Active Multi-Turn Information Acquisition for Abductive Inference

模型评测模型能力评测

摘要

溯因推理需要形成假设来解释观察到的证据,并在新证据出现时对其进行修改。虽然 大语言模型 (LLM) 经常被评估是否正确地解决了溯因推理任务,但人们对他们如何获取证据、更新假设以及决定何时停止知之甚少。我们介绍外星人绑架游戏,这是一种交互式探针,用于研究不同交互模式下的这些行为。这些模式的不同之处在于证据是预先提供还是交叉提供,以及查询是由模型选择还是由预言机提供示例。在各个模型中,预先提供证据比轮流分发证据的成功率更高。在多回合设置中,某些模型在使用可用证据之前进行提交,而其他模型则耗尽回合预算而不收敛。尽管模型的最终假设与他们选择的证据更加一致,但当预言机提供示例时,模型的成功率也比选择自己的查询时更高。这些发现表明,模型可能会形成适合自选证据的假设,而无法将其与替代证据充分区分开来,并且可能难以验证和完善其假设或确定何时停止。