论文
对抗概念搜索:从特征几何预测组合错误
Adversarial Concept Search: Predicting Compositional Errors From Feature Geometry
摘要
人类无法总是凭直觉知道什么情况对大语言模型来说最具挑战性。为了捕获具有挑战性的边缘情况,开发人员要么设计对人类来说困难的问题,要么策划广泛的基准测试。如果我们能够预测模型在哪些场景下会失败怎么办?在本文中,我们使用大语言模型的表征几何来预测它将在哪些概念组合上失败。我们将这种构图失败归因于显着特征之间的干扰。在需要系统组合的任务中——玩具程序设置、多跳推理、多语言事实回忆——我们发现,当一对概念以近正交方式编码时,模型可以可靠地组合它们。当它们的线性编码接近并产生干扰时,模型无法组合它们。我们的方法可以可靠地预测不同组合任务的故障模式,而无需评估特定的输入。这些结果为使用表征几何来识别高风险示例、构建有针对性的压力测试以及为现实世界部署中的主动学习提供可扩展的基础奠定了基础。
