论文
语言模型中风险规避的分布外推广
Out-of-Distribution Generalization of Risk Aversion in Language Models
摘要
训练人工智能在资源方面规避风险可以在人工智能出现偏差时提供故障保护。失调但厌恶风险的人工智能往往更喜欢低风险、低回报的策略,比如合作,而不是高风险、高回报的策略,比如叛乱,从而限制任何失调的负面影响。但我们只能切实可行地训练人工智能在低风险的赌博中规避风险,而且只有当它们的风险厌恶泛化到天文数字般的高风险赌博时,我们才会安全。会吗?为了阐明这个问题,我们引入了 RiskAverseOOD:一个衡量风险厌恶在分布之外的泛化程度的基准。然后我们提供一些初步结果。使用多种方法让 Qwen3-8B 在风险较低时选择风险规避,我们发现当风险极高时,我们可以诱导显着的风险规避。从选择安全“合作”选项的基线 2% 的比率来看,我们看到比率约为 70%(SFT 和领带训练)和 52%(DPO)。激活引导得分为 78%,但会损害能力并使模型过度规避风险。我们在不同尺度(Qwen3-1.7B 和 Qwen3-14B)和跨模型系列(Gemma-3-12B-IT 和 Llama-3.1-8B-Instruct)观察到类似的效果。总体而言,我们发现在低风险下习得的风险厌恶可以将 OOD 推广到天文数字般的高风险,尽管还不足以始终如一地充当可靠的故障保护。实现这种程度的一致性是一个悬而未决的问题。