论文
DRInQ:通过受控上下文变化评估会话含义
DRInQ: Evaluating Conversational Implicature with Controlled Context Variation
摘要
人类对话在很大程度上依赖于会话含义,说话者传达的含义是暗示的而不是明确表述的。尽管最近的 大语言模型 表现出很强的会话流畅性,但当解释依赖于整合社会和上下文线索的推理时,它们仍然不可靠,而这一过程很少在文本中阐明。我们引入了 DRinQ,这是一个评估问题话语中会话含义的语用推理的基准,旨在隔离语用变化,同时保持每个问题的表面形式固定。为了支持可扩展的评估,我们提出了一种半自动管道,可以生成具有系统变化的问题上下文解释实例。在评估过程中,我们发现了一致的生成推理不对称性:虽然最先进的模型可以在指导下生成合理的实用场景,但它们通常无法在推理时恢复预期的含义。对于较小的模型,结构化提示可以提高与人类判断的一致性。比较写作研究进一步揭示了互补的优势:人类作者往往会产生更安全、可预测的上下文,而模型会生成各种场景,其解释有时会超出上下文支持。这些发现凸显了会话含义建模中持续存在的挑战,并激发了更多上下文敏感的评估框架。