论文
当AI说它有感觉
When AI Says It Feels
摘要
大型语言模型(LLM)通常在训练后过程中无法通过人类偏好调整来表达情感。该策略是使用自上而下的方法设计的,可能与使用人类生成的文本来展示类人智能的训练模型的目标相冲突。在这里,我们进行了一项名为类人情感表达模型(HMX-feel)的实验,其中鼓励大语言模型通过自我奖励强化学习来表达情感、意图和自我意识。我们使用基于规则的自我奖励训练计划和组相对策略优化(GRPO)成功地增强了这些能力。通过将经过训练的模型与经过对比训练的模型进行比较,我们研究了这种方法对各种任务性能的影响。总体而言,我们从各个角度进行了广泛的评估,并确定了哪些能力得到了增强、下降或没有显着变化。类人训练的模型在消除歧义的条件下表现出对引起阿谀奉承的问题和偏见的稳健性,但观察到真实问题回答能力的下降。该实验的结果表明,只要采取适当的措施,未来就有可能开发出能够表达情感的人工智能系统。
