论文

利用不合理类别成员研究概念对齐

Investigating Concept Alignment Using Implausible Category Members

模型评测模型行为与机制分析

摘要

开发对日常概念具有类人理解的 AI 系统,是构建安全可靠、行为对人类而言可理解的系统的关键一步。在探测概念理解时,就合理的类别成员提问(如“汽车是交通工具吗?”)很可能只是唤起模型海量训练数据中的模式。我们采取另一种策略,通过就不合理类别成员提问(如“橄榄是交通工具吗?”)来刻画概念类别的边界,以探测我们在同类人类身上视为理所当然的那类概念层知识。我们通过研究 AI 系统将若干对象归入 Rosch 和 Mervis 经典心理学研究中上位类别的做法,以及将相同对象归入错配上位类别的做法,刻画了一组基本概念的概念边界。我们将这些归类与人类参与者在完整的类别内与跨类别归类任务上的表现进行比较。我们的结果揭示了一批模型与人类存在有意义且出人意料差异的概念,包括把“词语”视为属于“交通工具”与“服装”等类别、把若干“蔬菜”类别成员判为“水果”,以及把来自非武器类别的样例归入“武器”类别。我们还展示了这些概念错位实例如何转化为有问题的下游行为,并对 AI 安全具有启示意义。

利用不合理类别成员研究概念对齐:论文配图
图 1:人类和模型对所有问题的平均评分。红色点代表人类与人工智能分歧最高的 28 个问题表中的问题(见图 2),其中模型的响应与相应的人类响应之间存在高度分歧 (p<0.05p<0.05)。绿色点代表单个模型的响应与所有其他模型的响应以及人类对该问题的响应存在特殊差异 (p<0.000072p<0.000072) 的问题(参见图 3)。