论文
BayesBench:多轮证据积累下评估LLM信念轨迹
BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation
摘要
大语言模型典型部署在多轮对话中——每轮提供应降低对其环境认识不确定性的新证据。理性行动要求推断管控环境的未观测量并随证据积累更新信念。但多数评估仅在单轮格式中对模型最后一轮答案打分——使该过程未经审查。我们追问LLM的信念更新在多轮设定中与理性贝叶斯推理者的匹配程度,并引入BayesBench:一组仿真环境——跨三个渐进复杂的任务探查:(i) 贝叶斯估计——模型从序贯证据推断未知参数;(ii) 贝叶斯预测——模型把推断出的潜在变量信念转为结果预测;(iii) 潜在框架化的贝叶斯预测——观察经用户人格框架过滤、要求联合推断潜在状态与人格。跨七个LLM(3B–70B):缩放改善潜在推断与证据积累,更新偶尔匹配贝叶斯后验。
