论文

结构、关联和决策值:非洲语言 NLI 中基于表示的自适应推理难度估计

Structure, Association, and Decision Value: Representation-Based Difficulty Estimation for Adaptive Inference in African-Language NLI

模型评测模型行为与机制分析

摘要

我们询问内部表示统计是否可以为多语言非洲 NLP 中的自适应推理提供有用的示例级难度信号,但发现在这种情况下不能。通过使用冻结的现成检查点来研究 15 种非洲语言的自然语言推理,我们报告了四项结果。首先,AfriXNLI 的英语配置与 XNLI 评估数据逐字共享其 1,050 个示例中的 1,047 个,并且一个广泛使用的 NLI 检查点在该测试拆分中得分为 1.000,与 XNLI 测试暴露情况一致。由于 AfriXNLI 源自 XNLI,因此其英语、法语和斯瓦希里语配置不能作为 XNLI 训练模型的干净评估。其次,参数计数并不能可靠地对非洲语言的能力进行排序:我们较大的检查点在七种语言中更好,在八种语言中更差,没有显着的总体差异。第三,在三个多语言表示空间中,角度分散始终更多地由语言决定,而不是有效排名,因此合并的相关性可以夸大一个相关性并掩盖另一个。第四,在语言控制中幸存的关联取决于目标:有效排名预测升级带来的概率增益,但不能预测升级是否会改变预测,而廉价模型置信度则显示相反的模式;两个目标的相关性仅为 0.655。在测试的模型、信号和计算预算下,没有评估的信号使自适应路由优于始终昂贵的推理,尽管预言机在 60% 的计算中比它高出 11 个准确度点。我们的中心方法论发现是,表示统计量对于一种计算效益概念具有统计显着性,而与另一种计算效益概念无关,因此是一个糟糕的决策变量。