论文
SymboUQ:LLM空间推理中的符号不确定性量化
SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs
摘要
尽管大语言模型(LLMs)可以生成流畅的语义空间推理轨迹,但它们的中间关系可能不足以支持最终结论,使得基于单个标记的可靠性评估不足。现有的形式化验证器提供了更强的语义证据,但其适用性是有限的:一个解析的声明并不一定需要产生一个明确的语义结论。为了解决这个问题,我们引入了SymboUQ,这是一种符号不确定性量化框架,通过区分符号化能力(一个声明是否可以在验证器的正式语言中表示)和语义确定性(其执行是否产生一个合乎逻辑或矛盾的结论,而不是未知或不可评估的结果)来估计最终答案的可靠性。SymboUQ包括(i)一个布局审计员,它执行有序的空间声明并提取可行性、冲突和修复证据;(ii)一个无标签的确定性轮廓,它描述了有效的可执行覆盖;以及(iii)一个确定性-aware可靠性组合器,它根据验证器的适用性整合约束性、表示性和解码性分数。在五个空间推理基准上的大量实验中,SymboUQ相对于最强的基准在AUROC上实现了约8%的相对改进,在平衡类别不平衡的Brier损失上实现了约7%的相对减少。
