论文

TPvG:从单次决策到序贯反馈的大语言模型道德决策框架

TPvG: A Moral Decision Framework for Large Language Models from One-Shot to Sequential Feedback

模型评测基准与评测资源

摘要

现有的LLM道德评估通常提出具有孤立的道德小插曲的模型,并引发单次决策,忽略了一个已知的深刻影响人类道德行为的因素:结果反馈。我们引入了 TPvG(基于文本的痛苦与收益),它改编自人类道德范式,它将结果反馈嵌入到不伤害他人与最大化自我收益的日常道德困境中。 TPvG 包含五个道德决策任务,从最小背景的一次性选择发展到具有明确结果反馈的顺序决策。我们的结果表明,LLM的道德决策受到决策格式(一次性与顺序)的强烈影响,并且明确的接收者反馈在模型之间产生了异质效应。此外,LLM对明确的接收者反馈的反应与人类参考模式不同,这表明可能存在不同的决策过程。这些发现凸显了评估LLM道德行为在高风险互动环境中是否保持稳定的必要性。

TPvG:从单次决策到序贯反馈的大语言模型道德决策框架:论文配图
图1:TPvG建筑概况。(a) 原人类PvG范式。(b) 建立基于文本的数据集。(c) 共享系统提示。底端面板显示五个TPvG任务格式,从一拍即决选择到顺序决定,同时增加背景和反馈信息。