论文

对抗概念搜索:从特征几何预测组合错误

Adversarial Concept Search: Predicting Compositional Errors From Feature Geometry

模型评测模型行为与机制分析

摘要

人类无法总是凭直觉知道什么情况对大语言模型来说最具挑战性。为了捕获具有挑战性的边缘情况,开发人员要么设计对人类来说困难的问题,要么策划广泛的基准测试。如果我们能够预测模型在哪些场景下会失败怎么办?在本文中,我们使用大语言模型的表征几何来预测它将在哪些概念组合上失败。我们将这种构图失败归因于显着特征之间的干扰。在需要系统组合的任务中——玩具程序设置、多跳推理、多语言事实回忆——我们发现,当一对概念以近正交方式编码时,模型可以可靠地组合它们。当它们的线性编码接近并产生干扰时,模型无法组合它们。我们的方法可以可靠地预测不同组合任务的故障模式,而无需评估特定的输入。这些结果为使用表征几何来识别高风险示例、构建有针对性的压力测试以及为现实世界部署中的主动学习提供可扩展的基础奠定了基础。

对抗概念搜索:从特征几何预测组合错误:论文配图
(a) 表示空间中的大规模结构。(b) SCAN 示例。图 2:控制大规模表示结构后,可以从特征干扰中预测组合泛化。 (a) 表示按与感兴趣的概念无关的全局结构聚类。颜色表示来自同一主题子集(第 9 层)的示例。 (b) 第 3 节的组合失败的假设说明。两个命令共享相同的结构,但在一个概念上有所不同(运行与跳跃)。顶部的相关原子概念几乎是正交的,可以实现正确的组合。