论文

BayesBench:多轮证据积累下评估LLM信念轨迹

BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation

模型评测基准与评测资源

摘要

大语言模型典型部署在多轮对话中——每轮提供应降低对其环境认识不确定性的新证据。理性行动要求推断管控环境的未观测量并随证据积累更新信念。但多数评估仅在单轮格式中对模型最后一轮答案打分——使该过程未经审查。我们追问LLM的信念更新在多轮设定中与理性贝叶斯推理者的匹配程度,并引入BayesBench:一组仿真环境——跨三个渐进复杂的任务探查:(i) 贝叶斯估计——模型从序贯证据推断未知参数;(ii) 贝叶斯预测——模型把推断出的潜在变量信念转为结果预测;(iii) 潜在框架化的贝叶斯预测——观察经用户人格框架过滤、要求联合推断潜在状态与人格。跨七个LLM(3B–70B):缩放改善潜在推断与证据积累,更新偶尔匹配贝叶斯后验。

BayesBench:多轮证据积累下评估LLM信念轨迹:论文配图
图 9:最终回合紧急程度混淆矩阵,准确的患者状况,按参数计数排序。级别指数为 0 = 紧急、1 = 紧急、2 = 观察、3 = 常规。紧急情况得到可靠识别(约 1.00\约 1.00 顶行)。最小的模型将例行公事分解为观察/紧急,而较大的模型则重新出现规模的底部。