论文
你会步行去洗车场吗? LLM 常识推理中的显着性偏差
Would You Walk to the Car Wash? Salience Bias in LLM Commonsense Reasoning
摘要
尽管复杂推理取得了进步,但 大语言模型 (LLM) 可以优先考虑显式输入条件而不是隐式任务先决条件。在日常常识推理中,这可能会导致我们称之为显着偏差的失败:显着但与任务无关的细节(例如数值)将模型引入计算,而忽略了任务的物理或常识先决条件。一个关键的悬而未决的问题是,这种失败是否反映了常识性知识的真正差距,或者仅仅是在误导性任务框架下的压制。为了研究这一点,我们构建了 SaliTrap 基准,包含四个陷阱维度的 1,145 个项目。通过评估 12 LLM,我们发现测试模型存在重大漏洞,较高的干扰物数值与较低的陷阱避免率相关,而陷阱识别并不总是导致避免。对阿谀奉承案例的进一步探讨表明,当原始任务框架被删除时,通常可以引出相关的常识,这表明在任务执行过程中识别约束和应用约束之间存在差距。在此诊断的基础上,我们进一步表明,轻量级的推理时间提示本身就可以在无需任何再训练的情况下显着缩小差距。我们的研究结果强调了在任务执行过程中应用常识约束的重要性,并且我们发布了 SaliTrap 作为研究这一差距的测试平台。代码可在 https://github.com/Wuzheng02/SaliTrap 获取