论文

除非您知道自己在说什么,否则不要“嗯,实际上”我:薄弱的预设验证会降低一般 QA 性能

Don't `Well, Actually' Me Unless You Know What You're Talking About: Weak Presupposition Verification Degrades General QA Performance

模型评测模型行为与机制分析

摘要

错误预设 QA (FPQA) 测试 LLM 识别问题中错误预设并放弃或纠正它们而不是强化错误假设的能力。常见的方法将任务简化为提示 LLM 提取预设并对每个预设进行事实检查。虽然专用基准测试的表现不断提高,但评估主要集中在带有错误预设的问题(FPQ)上,而忽略了“正常”问题(TPQ)上的表现。由于与自然发生的情况相比,许多基准测试过度代表了 FPQ,因此结果是这些基准测试的性能并不能反映真实世界的 QA 性能。通过对各种模型系列、规模和基准的广泛实验,我们表明,在 FPQ 上表现较好的方法往往在 TPQ 上表现较差。我们的分析表明,这是事实检查模块薄弱的结果,这些模块也拒绝了真实的预设。我们希望我们的研究结果能够帮助指导未来的 FPQA 方法的工作,这些方法可以很好地推广到现实环境。