论文
用LAPITHS驯服Centaur:一个以理论为根基解读AI表现的框架
Taming the Centaur(s) with LAPITHS: a framework for a theoretically grounded interpretation of AI performances
摘要
我们提出一个名为LAPITHS(Language model Analysis through Paradigm grounded Interpretations of Theses about Human likenesS)的框架,并用它表明,被提议为人工统一认知模型的CENTAUR等模型所推进的若干重大主张,在理论和经验上都缺乏依据。LAPITHS提供了一个有原则的参照点,用以抵制当前AI研究中的一种行为主义倾向——把基于transformer的语言模型达到人类水平的表现解读为底层计算与人类相似的证据,并进而解读为认知能力的标志。LAPITHS的新颖之处在于将论证明确建立在两项定量评估之上:(i)Minimal Cognitive Grid,一种有理论动机、用于估计人工系统认知合理性的方法;(ii)一项行为比较,表明与CENTAUR类模型所报告相似的结果,可以由不满足通常与认知合理性相关之结构约束的其他系统复现,且这些系统的输出并不能为人类认知提供独立的解释性洞见。
