论文

模型何时该改变想法?大语言模型中的情境信念管理

When Should Models Change Their Minds? Contextual Belief Management in Large Language Models

模型评测基准与评测资源

摘要

长视野交互需要语言模型来管理累积的信息:何时更新其状态,何时保留其状态以及忽略什么。我们将这一挑战研究为 \textbf{情境信念管理(CBM)}:保持与正式证据一致的预测信念状态,同时隔离与任务无关的噪音。为了使 CBM 可测量,我们引入了 BeliefTrack,这是一个涵盖规则发现和电路诊断的封闭世界基准,其中有限的置信空间和符号验证器可以实现精确的回合级评估。 BeliefTrack 诊断三种故障:停留失败、更新失败和隔离失败。在多个大语言模型中,普通模型表现出严重的 CBM 失败,而明确的信念跟踪提示提供的收益有限。相比之下,带有信念状态奖励的强化学习平均将失败率降低了 70.9%。进一步的探索揭示了这些失败背后潜在的信念状态动态,并且表示级转向将两个任务的失败率降低了 46.1%\footnote{代码即将在 https://github.com/zjunlp/CBM 上发布。

模型何时该改变想法?大语言模型中的情境信念管理
图 1:情境信念管理 (CBM) 概述。 CBM 要求模型在信念空间上维持预测的信念状态,仅在有正式证据保证时才更新它,并过滤与任务无关的上下文或噪音。规则发现试点研究揭示了前沿模型中存在的重大信念管理错误。