论文

用LAPITHS驯服Centaur:一个以理论为根基解读AI表现的框架

Taming the Centaur(s) with LAPITHS: a framework for a theoretically grounded interpretation of AI performances

模型评测评测方法与指标

摘要

我们提出一个名为LAPITHS(Language model Analysis through Paradigm grounded Interpretations of Theses about Human likenesS)的框架,并用它表明,被提议为人工统一认知模型的CENTAUR等模型所推进的若干重大主张,在理论和经验上都缺乏依据。LAPITHS提供了一个有原则的参照点,用以抵制当前AI研究中的一种行为主义倾向——把基于transformer的语言模型达到人类水平的表现解读为底层计算与人类相似的证据,并进而解读为认知能力的标志。LAPITHS的新颖之处在于将论证明确建立在两项定量评估之上:(i)Minimal Cognitive Grid,一种有理论动机、用于估计人工系统认知合理性的方法;(ii)一项行为比较,表明与CENTAUR类模型所报告相似的结果,可以由不满足通常与认知合理性相关之结构约束的其他系统复现,且这些系统的输出并不能为人类认知提供独立的解释性洞见。

用LAPITHS驯服Centaur:一个以理论为根基解读AI表现的框架:论文配图
图 1:归因谬误问题的图示,其中尽管使用结构上不同的机制,但人类和人工智能产生相同的输出,导致将解释自然系统中行为的能力理论不合理地归因于人工智能系统。