论文
迈向格莱斯撤退:探索 LLM 的知识边界和所指特异性
Toward a Gricean Retreat: Probing LLMs for Knowledge Boundaries and Referent Specificity
摘要
当被问及知识范围之外的实体时,LLM 通常会捏造听起来合理的细节,而不是退回到更安全、更笼统的主张。我们通过格里斯的视角来描述这一失败:一个对所指对象不确定的合作演讲者会退回到特异性层次,以信息性换取真实性。我们询问LLM是否有进行这次静修的成分。使用基于 T-REx 的基准来改变实体熟悉度和所指对象特异性,我们探索模型来回答两个问题:(i)它们的激活是否编码所指对象是否落入知识边界内,以及(ii)它们是否预测它们将要生成的所指对象的特异性?我们发现两者的答案都是肯定的,但是这两个信号在生成时并不一致。模型绝大多数更喜欢特定的参照物,即使实体对它们来说是未知的,即使提供了正确的通用替代品,模型也会这样做。格莱斯撤退的基础已经存在,但据此采取行动的政策却还没有。我们将我们的发现定位为实现 Gricean 对齐、训练或指导目标的第一步,这些目标将知识边界意识与生成过程中的指涉特异性结合起来。