论文
XYBench:LLM 能否务实地回应带有误解的询问?
XYBench: Can LLMs Respond Pragmatically to Queries with Misconceptions?
摘要
当非专家用户向 LLM 寻求帮助时,他们的查询通常可能会产生误解(例如,“如何使用正则表达式解析 XML?”)。在这种通常称为 XY 问题的情况下,LLM 必须识别误解(“正则表达式很脆弱”),并有意义地引导用户采用实用的解决方案,以解决请求中隐含的根本问题(“使用 XML 解析器”)。我们引入了 XYBench,这是一个包含 8,115 个此类查询的基准,这些查询来自技术(StackOverflow/StackExchange)和日常(WikiHow 和手动管理的子集)领域。我们设计了一个评估范式,根据基于合作响应理论的三个标准评估模型响应:(a)存在和(b)强调务实的解决方案,以及(c)识别误解。我们的实验表明,即使是最强的 LLM 也主要回答字面请求 (0.75--0.92),而很少回答预期请求 (0.33--0.71),同时在识别误解方面大大落后于人类(最多 63% 对 79--90%)。此外,模型在多项选择设置中绝大多数更喜欢务实的响应,但始终无法生成它们。 Oracle 消融实验表明,在生成时提供明确的用户意图会有所帮助;然而,仍然存在很大差距,这表明实用重定向在当前 LLM 中根本上是一项尚未开发的功能。