论文

Know2Guess:大语言模型 中知识边界评估的污染感知多区域基准

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models

模型评测基准与评测资源

摘要

对 大语言模型 的可靠评估应将受支持的回答与不受支持的猜测分开,而不会与数据污染、提示特质或一般拒绝行为混为一谈。我们提出了一个污染感知的多区域基准,用于衡量在冻结构建时间标签下从可回答的知识到弃权预期未知的转变。该基准包含跨五个领域的 1,200 个项目、明确的弃权期望、污染风险元数据以及使用官方严格解析器和标准化稳健性解析器的双重解析。我们在锁定的回答或弃权提示、仅回答控件和提示模板变体下评估 FLAN-T5、Qwen2.5-Instruct 和 Llama-3-Instruct 模型。该基准不能通过一般的不回答行为来解决:FLAN 基线在有效弃权方面仍然较弱,而更强的指令调整模型则暴露了从回答到弃权的选择性但不完整的转变。 Qwen2.5-3B-Instruct 实现了最佳的整体可靠性,但答案预期区域仍然很困难,校准仍然很差,并且良性项目拒绝仍然存在。提示和解析器稳健性分析保留了主要排名和定性结论。因此,该基准提供了一个可重复的协议,用于审核可回答性、弃权、拒绝和污染,将其作为 LLM 可靠性的不同但相互作用的维度。该数据集可在 https://github.com/renweimeng/Know2Guess-A-Contamination-Aware-Multi-Zone-Benchmark 上公开获取。