论文

部分大语言模型表现出一致的风险态度

Some Large Language Models Exhibit Consistent Risk Attitudes

模型评测模型行为与机制分析

摘要

随着AI系统被部署在开放式、高风险场景,一个关键维度仍未被测量:感知到的风险如何转化为行动。我们检验大语言模型(LLM)在不确定性下是否表现出系统性、一致的风险态度。我们引入一个把情境风险信念与类别决策解耦的跨领域框架,应用于六个代表性LLM与100名人类被试,覆盖空间导航、临床分诊与金融配置任务。用回归模型提取每个智能体的信念—决策映射,量化风险敏感度与风险态度偏差。我们发现,多数受测LLM表现出:(i)任务内稳健一致性,即在固定任务域内从情境信念到风险决策的映射稳定;(ii)跨领域序数稳定性,即在任务间保持相对风险姿态;(iii)相对更宽的人类基线,向一个受限的风险态度分布收敛。这些结果揭示风险态度是LLM行为的一个稳定且此前未被刻画的维度,为在开放式决策中评估与对齐AI系统奠定基础,并推动对其内在行为倾向 origins 的进一步研究。

部分大语言模型表现出一致的风险态度:论文配图
图 1:隔离和衡量风险态度的框架。不确定性下的代理行为被分解为一系列从观察(OtO_{t})到事实信念(BFB_{F})、情境信念(BCB_{C})和分类风险决策(RDR_{D})的转换。通过隔离上下文信念到决策的映射(BC→RDB_{C}\rightarrow R_{D}),该框架将风险感知与行动分开,从而能够直接测量风险态度,而无需考虑事实准确性或信念校准。