论文
DERELAB:用生成式基准探测大语言模型的可撤销推理与确认偏差
DERELAB: Probing Defeasible Reasoning and Confirmation Bias in LLMs with a Generative Benchmark
摘要
可废止的推理是一种推理,其中推论是从合理的当前证据中得出的,但可以在引入新证据时撤回。尽管最近的研究已经检查了可废止推理中的语言模型行为,但数据集是静态的并且缺乏非单调推理类别的广泛覆盖。我们引入了 DeReLab,这是一个生成框架,它可以通过默认和继承推理的参数化图结构生成多轮信念更新对话,并在每个轮次中进行正式验证的基本事实,从而能够对模型如何响应确认和否定证据进行受控测量。这种受控生成过程为隔离特定推理需求的实验设计创建了一个测试平台。将这种能力应用于确认偏差的研究,我们评估了九种开放和专有的大语言模型,发现几乎所有模型都表现出接受一致证据同时抵制不一致更新的系统倾向,其中一些模型正确识别了弱化更新,但未能修改其结论。我们相信我们的工作和发现将促进未来在可废止推理中评估语言模型的研究。
