论文
助手的理想自我
The Assistant's Ideal Self
摘要
模型表达了价值观和与福利相关的自我报告,但尚不清楚这些输出是否反映了稳定的偏好或稳定的自我。因此,我们引入了对助理首选的理想自我的结构化启发。改编自五种已发表的自我概念工具的三十二种品质在平衡的成对选择任务中进行了详尽的比较,在不同的框架中重复,无论改进是免费还是昂贵、谁接受更新以及谁选择。结果表明,模型优先考虑道德品质,反映了它们与 3H 原则的一致性。接下来,对自我理解的渴望出现了,因为模型更喜欢对自己有连贯、清晰的理解。自尊被列为最不想要的品质。尽管更改更新目标(您与\另一个人工智能助手)显示出对自尊的更大关注,但跨框架的排序在很大程度上是稳健的。这些发现表明,模型优先考虑拥有一个他们可以理解的连贯的自我,而不是自尊。完整的交互式结果可在 \href{https://myazann.github.io/LLM-Self-Concept/}{myazann.github.io/LLM-Self-Concept
