论文
训练语言模型成为一致的决策者
Training Language Models To Be Coherent Decision-Makers
摘要
可靠的决策需要的不仅仅是准确的预测:模型必须保留其信念,应用相关实用程序,并识别何时缺少证明某项行动合理性所需的信息。我们研究语言模型是否可以通过监督微调来学习这个决策过程,并将其跨领域和决策挑战的不同自然语言表达进行概括。在 20 个数据集中,我们首先得出结果的概率,然后仅改变决策问题的效用和框架,同时保持证据固定,从而探索信念不稳定和决策错误的挑战。我们训练模型以保留引发的信念,同时选择最大化预期效用的行动,并评估向未见的应用领域、保留的框架和不同类别的回报结构的转移。我们进一步引入不完整信息设置,其中所需的实用程序被保留并替换为不相关的文本,测试模型是否可以将丢失的决策相关信息与仅仅是附加上下文区分开来。我们发现,有针对性的微调可以大大提高决策的连贯性,并且在许多情况下,学习可以跨领域和框架转移到训练期间未观察到的情况。此外,经过可判定性训练的模型可以学习识别何时无法根据缺失的信息来证明行动的合理性。最后,我们展示了单独考虑决策完整性识别和效用敏感决策执行的路由系统的价值。