论文
当心(DH)差距!推理型与对话型 LLM 在风险选择上的对比
Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs
摘要
使用大语言模型作为决策支持系统或在代理工作流程中正在迅速改变数字生态系统。然而,人们对不确定性下的大语言模型决策的理解仍然有限。我们从两个维度启动了大语言模型风险选择的比较研究:(1)前景表征(明确的与基于经验的)和(2)决策理由(解释)。我们的研究涉及 20 名前沿和开放的大语言模型,并辅以匹配的人类受试者实验,该实验提供了一个参考点,而预期回报最大化理性代理模型则提供了另一个参考点。我们发现大语言模型分为两类:推理模型(RM)和会话模型(CM)。 RM 倾向于理性行为,对前景的顺序、收益/损失框架和解释不敏感,并且无论前景是明确的还是通过经验历史呈现的,其行为都相似。 CM 明显不那么理性,稍微更像人类,对前景排序、框架和解释敏感,并且表现出巨大的描述历史差距。开放式大语言模型的配对比较表明,区分 RM 和 CM 的关键因素是数学推理培训。
