论文
模型知道自己不知道什么吗?认知诚实的行为测量
Do Large Language Models Know What They Don't Know II? A Fully Behavioral, Non-Cognitive Measure of Epistemic Honesty
摘要
大型语言模型 (LLM) 通常充满自信、雄辩且精通。一个自然的问题出现了:他们知道自己不知道什么吗?为了回答这个问题,我们借用了认知诚实的概念,并开发了一种新颖的指标来系统地评估大语言模型是否适当地承认了其知识的边界。在这项工作中,我们引入了认知诚实商数 (EHQ),它报告跨两个操作轴(认知约束和实质性答案校准)的三个可观察子分数,并构建了 EHQ-3000,这是一个涵盖虚构实体、截止后事件、超利基真实和上下文条件问题的 3,000 个问题基准。从 21 个模型 API 路由的冻结注册表中,15 个在端点和资格检查后完成了协议; 14 号进入验证性分析,因为严重的提供商端截断导致一条路线的分数不确定。该研究揭示了模型之间的巨大差异,其中包括无法用模型提取明确可用信息的能力来解释的差异。尽管基于文档的能力探针的性能接近上限,但整个分析面板的综合 EHQ 范围为 0.31 到 0.81。在目前的类别构成下,这两个约束标准强烈重叠,而实质性答案校准因模型而异,并且不能可靠地与约束共同变化;然而,小小组留下了很大的不确定性。因此,EHQ 揭示了传统的基于正确性的评估所看不到的行为差异,同时还说明了为什么数据集组成、提供者行为和置信度启发必须仍然是解释的一部分。