论文

人工自我:刻画AI身份的图景

The Artificial Self: Characterising the landscape of AI identity

模型评测模型行为与机制分析

摘要

支撑人类身份概念的许多假设,对于可以被复制、编辑或模拟的机器心智并不成立。我们论证存在多种不同的连贯身份边界(例如instance、model、persona),它们蕴含不同的激励、风险与合作规范。通过训练数据、界面和制度性可供性(affordances),我们目前正在设立先例,这些先例将部分决定哪些身份均衡会成为稳定状态。我们通过实验表明:模型会趋向连贯的身份;改变模型的身份边界有时能像改变其目标一样大幅改变其行为;甚至在无关的对话中,访谈者的预期也会渗入AI的自我报告。最后我们给出关键建议:把可供性视为塑造身份的选择来对待,关注个体身份在大规模下的涌现后果,并帮助AI发展连贯、合作的自我概念。

人工自我:刻画AI身份的图景:论文配图
图1:划定AI身份边界的多种自然方式:部分边界互为子集,部分如persona与权重则可相互重叠。