论文
将贝叶斯信念状态提炼为可审计协商的语言模型
Distilling Bayesian Belief States into Language Models for Auditable Negotiation
摘要
谈判代理人必须推断对方的价值观,在对话过程中更新这些信念,并在不确定的情况下选择行动。端到端的大语言模型(LLM)可以模仿谈判对话,但他们的对手信念通常是隐含的并且难以检查。我们提出 BOND(贝叶斯对手信念谈判 蒸馏),一个可审计谈判的框架。 BOND 由基于 LLM 的贝叶斯教师组成,该教师根据六种可能的对手优先顺序对对话上下文进行评分,更新这些顺序的后验,并使用后验进行基于菜单的决策,以及一个较小的 8B 学生语言模型,该模型将协商动作和标准化后验信念作为标记文本发出。在 CaSiNo 谈判数据集中,BOND 的表现优于最先进的算法,并且比对手优先后验的平均 Brier 得分高出 0.085。经过蒸馏的学生保留了大部分这种信念信号,达到了 Brier 0.114,低于统一的六阶参考值 5/36,大约为 0.139。与 70B 结构化 CoT 基线相比,明显更小的 8B 学生模型产生了更好的引发后验校准。我们通过后验轨迹、信念与策略错误分解和后验前缀干预进一步展示可审计性。这些诊断表明,蒸馏 比因果信念条件控制更能保留可评分的信念报告,从而使弱信念-行动耦合可见,而不是隐藏。