论文
大语言模型中信念稳定性的分级测量
Toward a Graded Measure of Belief Stability in Large Language Models
摘要
大语言模型 (LLM) 越来越多地调节人们获取信息和推理信息的方式,但事实可靠性通常是一次评估一种判断。我们引入了分级信念稳定性,这是一种衡量信念在LLM更广泛的信念体系中持续程度的相关衡量标准。与个人信念概率不同,它询问当将某个主张与模型的其他认知承诺一起考虑时,对该主张的支持是否持续存在。我们使用直接条件估计器来操作这个想法,该估计器使用内部模型表示来估计条件置信概率。在 12 个LLM和三个领域中,在匹配个体信念概率后,在 83.3% 的模型域设置中,在对话挑战下,稳定性较低的信念表现出更大的平均行为运动。因此,分级信念稳定性将可靠性评估扩展到LLM对主张的支持程度以及更广泛的信念体系中对该信念的支持程度。