论文

探索 LLM 风险决策中结果层面的相似性和机制层面的一致性:来自圣彼得堡博弈的证据

Probing Outcome-Level Resemblance and Mechanism-Level Alignment in LLM Risk Decisions: Evidence from the St. Petersburg Game

模型评测模型行为与机制分析

摘要

LLM 在风险决策任务中可能显得谨慎,但谨慎的输出并不一定表明与人类决策机制保持一致。我们使用圣彼得堡博弈作为受控测试平台来研究这种区别,这是一个经典悖论,其中预期收益是无限的,但人类通常报告较低且有限的支付意愿。我们使用包含原始游戏的结构化提示套件评估 28 LLM;扰乱截断、重复游戏、数字禀赋和职业认同的受控决策变量;人类视角的提示,要求模型作为人类决策者进行推理;以及基本模型和经过指令调整的模型之间的配对比较。在最初的游戏中,大多数模型都会生成有限的出价,从而产生类似人类的风险行为。然而,这种结果层面的相似性掩盖了机制层面的实质性差异。受控变体表明,模型通常会转向有条件和计算上的理性行为,而不是维持原始游戏中看到的类似人类的行为。人为提示提示和指令调整通常会降低出价并减少一些明显的病症,但大多数机制级别的响应模式基本上保持不变。这些发现表明,风险决策中的行为一致性可能是表面层面的:LLM 可能会产生类似人类的风险决策,但不会表现出与人类一致的机制。因此,对 LLM 决策的高风险评估应该超越结果相似性,并检查机制层面的一致性是否支持这种一致性。