论文

理性火花:推理LLM与人类判断和选择一致吗?

Sparks of Rationality: Do Reasoning LLMs Align with Human Judgment and Choice?

模型评测模型行为与机制分析

摘要

大语言模型(LLM)日益被定位为招聘、医疗与经济判断的决策引擎,然而真实世界的人类判断反映理性深思与情绪驱动偏见之间的平衡。如果LLM要参与高风险决策或充当人类行为的模型,关键在于评估它们是否表现出类似的(非)理性与偏见模式。为此,我们在(i)测试理性选择核心公理的基准和(ii)行为经济学与社会规范中情绪已知会塑造判断与选择的经典决策领域上评估多个LLM家族。跨设置地,我们表明深思式思考可靠地提升理性,并推动模型趋向期望值最大化。为探究类人情感扭曲及其与推理的交互,我们使用两种情绪引导方法:上下文启动(ICP)与表示层引导(RLS)。ICP诱发强烈且常极端、难以校准的方向性偏移,而RLS产生心理上更合理但可靠性较低的模式。我们的结果表明,提升理性的同一机制也放大对情感干预的敏感性,且不同引导方法在可控性与类人行为之间权衡。总体而言,这指向推理与情感引导之间的张力,对人类模拟与基于LLM的决策系统安全部署均有启示。

理性火花:推理LLM与人类判断和选择一致吗?
图1:我们研究 LLM 决策,聚焦于推理模型在上下文情绪操纵或通过向量注入下的表现。我们区分(上)中性思考、(中)关于情绪的思考与(下)情绪化思考。