论文
厌恶风险Agent的品格培训
Character Training for Risk-Averse Agents
摘要
资源中的风险规避可以防止人工智能Agent造成灾难性伤害。错位但规避风险的Agent往往会倾向于更安全的策略,例如与人类进行交易,而不是叛乱等风险较高的策略。我们通过性格训练来训练Agent规避风险,发现人物角色特征为灌输风险偏好提供了强有力的机制。为此,我们构建了一个模型构造,描述对Agent资源的恒定绝对风险规避(CARA),并通过在on-policy蒸馏来灌输它。尽管在训练期间从未见过基准的决策格式,但经过字符训练的模型与直接在其上训练的基线具有竞争力,并且在我们的四个模型中的两个模型上比分布更好地概括。我们还调整了宪法的不同方面,发现词元预算和模型选择是性格训练中灌输风险规避最有影响力的方面。从这些结果中我们得出的结论是,性格训练是一种有前途且可扩展的方式,可以灌输广泛的性格,我们可以利用它来减轻人工智能Agent错位带来的风险。