论文

概念挫败:协调人类概念和机器表示

Concept frustration: Aligning human concepts and machine representations

模型评测模型行为与机制分析

摘要

将人类可解释的概念与现代机器学习系统学到的内部表示相结合仍然是可解释人工智能的核心挑战。我们引入了一个几何框架,用于将受监督的人类概念与从基础模型嵌入中提取的无监督中间表示进行比较。受概念跳跃在科学发现中的作用的推动,我们将概念挫败的概念形式化:当未观察到的概念引起已知概念之间的关系而无法在现有本体论中保持一致时,就会出现矛盾。我们开发了任务对齐的相似性度量,可以检测基于概念的监督模型和从基础模型派生的无监督表示之间的概念挫败,并表明这种现象在任务对齐的几何中是可以检测到的,而传统的欧几里得比较失败了。在线性高斯生成模型下,我们推导出基于贝叶斯最优概念的分类器准确性的封闭式表达式,将预测信号分解为已知已知、已知未知和未知未知贡献,并分析性地识别挫折影响性能的地方。对合成数据以及真实语言和视觉任务的实验表明,可以在基础模型表示中检测到挫败感,并且将令人沮丧的概念纳入可解释的模型中可以重新组织学习概念表示的几何形状,从而更好地协调人类和机器推理。这些结果提出了一个原则框架,用于诊断不完整的概念本体并协调人类和机器的概念推理,对高风险应用的安全可解释人工智能的开发和验证具有影响。