论文
部分大语言模型表现出一致的风险态度
Some Large Language Models Exhibit Consistent Risk Attitudes
摘要
随着AI系统被部署在开放式、高风险场景,一个关键维度仍未被测量:感知到的风险如何转化为行动。我们检验大语言模型(LLM)在不确定性下是否表现出系统性、一致的风险态度。我们引入一个把情境风险信念与类别决策解耦的跨领域框架,应用于六个代表性LLM与100名人类被试,覆盖空间导航、临床分诊与金融配置任务。用回归模型提取每个智能体的信念—决策映射,量化风险敏感度与风险态度偏差。我们发现,多数受测LLM表现出:(i)任务内稳健一致性,即在固定任务域内从情境信念到风险决策的映射稳定;(ii)跨领域序数稳定性,即在任务间保持相对风险姿态;(iii)相对更宽的人类基线,向一个受限的风险态度分布收敛。这些结果揭示风险态度是LLM行为的一个稳定且此前未被刻画的维度,为在开放式决策中评估与对齐AI系统奠定基础,并推动对其内在行为倾向 origins 的进一步研究。
