论文
评估带有预设的查询的推理模型
Evaluating Reasoning Models for Queries with Presuppositions
摘要
数以百万计的用户转向人工智能模型来满足他们的信息需求。可以想象,大量的用户查询包含实际上可能不准确的假设。先前的工作指出,大语言模型 (LLM) 通常无法挑战此类错误假设,并且可能会强化用户的错误观点。然而,考虑到最近的进展,特别是在模型推理能力方面的进展,我们重新审视大型推理模型(LRM)是否可以推理潜在的假设并适当地响应用户查询。我们构建了涵盖健康、科学和一般知识的不同程度的预设查询,并用它来评估几个广泛部署的模型。与非推理模型相比,我们发现推理模型的准确度稍高(2-11%),但它们仍然无法挑战很大一部分(26-42%)的错误预设。此外,推理模型仍然容易受到预设表达强度的影响。