论文
机器会像人类一样犯错吗?映射错误对齐的以人为中心分布外光谱
Do Machines Fail Like Humans? A Human-Centred Out-of-Distribution Spectrum for Mapping Error Alignment
摘要
确定人工智能系统是否像人类一样处理信息是认知科学和值得信赖的人工智能的核心。虽然现代人工智能模型在标准任务上的准确性与人类相匹配,但这种一致性并不能保证其底层决策策略与人类信息处理保持一致。使用 i) 误差对齐指标来比较人类和模型的失败情况,以及 ii) 使用扭曲的或更具挑战性的刺激来评估性能,为更精细地表征模型与人类的对齐提供了可行的途径。然而,现有的针对挑战性刺激的分布外 (OOD) 分析由于方法选择而受到限制:它们定义相对于模型训练数据的 OOD 偏移,或使用与人类感知几乎不对应的任意失真特定参数,从而阻碍了原则性比较。我们提出了一个以人为本的框架,将 OOD 的程度重新定义为人类感知难度的范围。通过量化一组刺激与基于人类准确性的未失真参考集的偏差,我们构建了 OOD 谱并识别了四种不同的感知挑战机制。这种方法可以在校准的难度级别上进行有原则的模型与人类比较。我们将该框架应用于对象识别,并揭示深度学习架构中独特的、依赖于机制的模型-人类对齐排名和概况。视觉语言模型是人类在近 OOD 和远 OOD 条件下最一致的对齐方式,但对于近 OOD 条件,CNN 比 ViT 更对齐,而对于远 OOD 条件,ViT 比 CNN 更对齐。我们的工作证明了考虑跨条件差异(例如模型与人类对齐的原则性评估的感知困难)的至关重要性。
