论文

助手的理想自我

The Assistant's Ideal Self

模型评测模型行为与机制分析

摘要

模型表达了价值观和与福利相关的自我报告,但尚不清楚这些输出是否反映了稳定的偏好或稳定的自我。因此,我们引入了对助理首选的理想自我的结构化启发。改编自五种已发表的自我概念工具的三十二种品质在平衡的成对选择任务中进行了详尽的比较,在不同的框架中重复,无论改进是免费还是昂贵、谁接受更新以及谁选择。结果表明,模型优先考虑道德品质,反映了它们与 3H 原则的一致性。接下来,对自我理解的渴望出现了,因为模型更喜欢对自己有连贯、清晰的理解。自尊被列为最不想要的品质。尽管更改更新目标(您与\另一个人工智能助手)显示出对自尊的更大关注,但跨框架的排序在很大程度上是稳健的。这些发现表明,模型优先考虑拥有一个他们可以理解的连贯的自我,而不是自尊。完整的交互式结果可在 \href{https://myazann.github.io/LLM-Self-Concept/}{myazann.github.io/LLM-Self-Concept

助手的理想自我:论文配图
图1: 基线32个属性的COORT平均排名,显示前10个属性。酒吧是四个模型赢率的未加权平均值;胡须横跨最低至最高个人估计。