论文
诊断和改进大语言模型中的概率推理
Diagnosing and Improving Probabilistic Reasoning in Large Language Models
摘要
大语言模型(LLM)越来越多地被提议作为决策助手,必须在明确的决策成本下根据可用证据进行概率推理。我们提出了一个决策理论框架,将大语言模型的决策损失分解为两个组成部分:根据提供的证据形成准确的信念,并将这些信念转化为优化所提供的效用函数的行动。使用具有已知基本事实的综合基准,我们应用分解来表征前沿和开源模型中的概率推理。我们进一步评估针对信念、决策或两者的强化学习干预措施是否可以在三个领域改善这些组成部分,改进是否可以跨组成部分和启发格式转移,以及决策绩效是否可以在不改善信念形成的情况下得到改善。我们发现,针对概率推理的一个组成部分重新分配决策损失,改善目标而不必转移到其他部分,并且联合针对信念形成和决策制定可以改善两者,但取决于训练和评估之间的匹配格式。