论文

SymboUQ:LLM空间推理中的符号不确定性量化

SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs

模型评测评测方法与指标

摘要

尽管大语言模型(LLMs)可以生成流畅的语义空间推理轨迹,但它们的中间关系可能不足以支持最终结论,使得基于单个标记的可靠性评估不足。现有的形式化验证器提供了更强的语义证据,但其适用性是有限的:一个解析的声明并不一定需要产生一个明确的语义结论。为了解决这个问题,我们引入了SymboUQ,这是一种符号不确定性量化框架,通过区分符号化能力(一个声明是否可以在验证器的正式语言中表示)和语义确定性(其执行是否产生一个合乎逻辑或矛盾的结论,而不是未知或不可评估的结果)来估计最终答案的可靠性。SymboUQ包括(i)一个布局审计员,它执行有序的空间声明并提取可行性、冲突和修复证据;(ii)一个无标签的确定性轮廓,它描述了有效的可执行覆盖;以及(iii)一个确定性-aware可靠性组合器,它根据验证器的适用性整合约束性、表示性和解码性分数。在五个空间推理基准上的大量实验中,SymboUQ相对于最强的基准在AUROC上实现了约8%的相对改进,在平衡类别不平衡的Brier损失上实现了约7%的相对减少。

SymboUQ:LLM空间推理中的符号不确定性量化:论文配图
图1:SymboUQ 的整体框架。布局审计器依次执行空间陈述,生成基于约束的证据;确定性剖面衡量可符号化程度与有效语义分辨率;DARC 再依据这一轨迹级执行剖面,调整不同来源的最终答案可靠性信号。