论文

LLM 能否驾驭信念和事实取决于你如何表达它

Whether LLMs Can Navigate Beliefs and Facts Depends on How You Phrase It

模型评测模型行为与机制分析

摘要

人类在日常交流中自然地形成并表达信念,例如“我认为答案是 3”或“我认为这是对的”。这些信念不可避免地与事实和知识交织在一起,使得 大语言模型 (LLM) 需要同时处理它们的能力,因为它们越来越多地部署在面向用户的设置中。之前的研究表明,即使是有能力的 LLM 在承认基于不正确信息的用户信念方面也表现出系统性弱点。我们将此评估扩展到 18 个认知表达中的 10 LLM,发现这种弱点的大小和方向取决于用于表达信念的动词,事实和错误信息之间的准确度差距范围从“我模糊记得”的 +50% 到“我严重怀疑”的 -14%。我们进一步表明,这种现象源于我们所说的任务混乱:模型默认对潜在的主张进行事实检查,从而推翻了用户声明的信念。我们提供的证据表明,经过明确的事实核查的思想链在错误信息上的准确性低于那些没有进行事实核查的思想链,并且单个指令可以扭转动词家族之间的失败。从机制上讲,模型更多地关注它们无法确认的错误信念,但在解码时抑制这种关注只能部分且仅在某些模型中恢复准确性,这需要未来对干预方法的研究。我们的研究结果澄清了先前的结果,并表明事实核查(一种普遍理想的行为)如何干扰 LLM 中的信念跟踪。