论文
ArcticAbstain:评测LLM能否识别北极科研问题无有效答案
Arctic Questions, Missing Answers: A Dataset and Benchmark for LLM Abstention in Arctic Science
摘要
当没有选项有效时,大型语言模型(LLM)应该放弃科学的多项选择题,但仅仅频繁放弃并不能表明对答案可用性的敏感性。我们引入 ArcticQA,这是一个来自北极主要研究的 194 个问题数据集,可自动检查答案支持度和干扰源证据的矛盾性。我们进一步开发了 ArcticAbstain,这是一个比较有答案和无答案条件的配对基准,其中正确答案被后者中的干扰项取代,并且两者中都有明确的弃权选项。我们以高推理能力评估了 Gemini、Claude 和 ChatGPT 系列的 8 个模型,每种条件进行 3 次试验,产生 9,312 个记录响应。有答案的弃权率范围为 0.0% 至 63.0%,而替换正确答案会使弃权率平均增加 5.05 个百分点。这些发现强调了巨大的基线差异以及联合评估弃权频率和反应性的必要性。数据集和基准可在https://github.com/BenWilcox8/arctic-qa。获取