论文
模型何时该改变想法?大语言模型中的情境信念管理
When Should Models Change Their Minds? Contextual Belief Management in Large Language Models
摘要
长视野交互需要语言模型来管理累积的信息:何时更新其状态,何时保留其状态以及忽略什么。我们将这一挑战研究为 \textbf{情境信念管理(CBM)}:保持与正式证据一致的预测信念状态,同时隔离与任务无关的噪音。为了使 CBM 可测量,我们引入了 BeliefTrack,这是一个涵盖规则发现和电路诊断的封闭世界基准,其中有限的置信空间和符号验证器可以实现精确的回合级评估。 BeliefTrack 诊断三种故障:停留失败、更新失败和隔离失败。在多个大语言模型中,普通模型表现出严重的 CBM 失败,而明确的信念跟踪提示提供的收益有限。相比之下,带有信念状态奖励的强化学习平均将失败率降低了 70.9%。进一步的探索揭示了这些失败背后潜在的信念状态动态,并且表示级转向将两个任务的失败率降低了 46.1%\footnote{代码即将在 https://github.com/zjunlp/CBM 上发布。
