论文

LLM 中顺序信息收集的摊销贝叶斯实验设计

Amortising Bayesian Experimental Design for Sequential Information Gathering in LLMs

模型训练强化学习

摘要

大语言模型 (LLM) 表现出强大的推理和世界知识能力,但通常很难在顺序决策设置中所需的多轮交互中有效地收集信息。我们引入摊销顺序信息收集(ASIG),这是一种 微调 方法,通过具有预期信息增益奖励的组相对策略优化的多轮扩展,将贝叶斯实验设计(BED)摊销到 LLM 策略中。根据 20 个问题任务进行评估,相对于 BED-LLM(一项具有竞争力的推理时间基准),ASIG 使 7B 基本模型的成功率提高了一倍多,并将推理成本降低了 25倍以上。 ASIG 应用于 MediQ(训练过程中未见的医疗诊断基准),提高了 7B 级的信息查找性能,这表明学习到的策略可以转移出分布。我们的研究结果表明,将 BED 摊销到 LLM 策略中为顺序信息收集提供了一种有效且计算效率高的方法。