论文

LLM 不是(一致)贝叶斯:量化 LLM 概率信念的内部(中)一致性

LLMs are not (consistently) Bayesian: Quantifying internal (in)consistencies of LLMs' probabilistic beliefs

模型评测模型能力评测

摘要

现代人工智能系统正在被部署在医学、科学和法律等复杂领域,重要的是它们不仅要产生正确的答案,而且要随着新证据的到来代表和更新关于世界的不确定信念。我们引入了研究 LLM 作为信息处理规则的新技术,并利用信息处理间隙来研究 LLM 如何从证据更新其概率信念的内部(内)一致性。我们广泛的实验评估了 LLM 可以将证据融入他们的信念的多种方法。其中一些方法产生(接近)贝叶斯更新;其他人似乎使用了一种习得的启发式方法。令人惊讶的是,就下游任务性能而言,非贝叶斯启发式更新通常优于精确的贝叶斯计算,这表明 LLM 的世界概率模型被错误指定。最后,我们展示了我们的测量如何提供诊断来识别 LLM 支持的推理系统的问题。