论文
LLM 位置一致的序数分类器吗?系统评估
Are LLMs Positionally Consistent Ordinal Classifiers? A Systematic Evaluation
摘要
大语言模型 越来越多地用于序数分类,但提示组织的语义等效更改可能会改变其预测。我们进行系统实验,从标签顺序、演示顺序和演示位置来表征位置偏差。首先,我们将这三个探针应用于常见序数分类任务的十个前沿 LLM;每个模型对所有三个位置源都很敏感,这表明该问题是普遍存在的。其次,我们在五个数据集中改变了八个提示、任务和模型级别的因素;准确性和稳定性常常不一致,只有较低的尺度基数才能持续改善两者。第三,我们比较逐点、成对和列表推理、替代聚合和去偏方法以及联合配置;测试的修正并不能提供可靠的补救措施,而基于比较的列表公式提供了最佳平衡,但在模型和偏差源之间的转移不均匀。这些发现表明,位置鲁棒性取决于整个系统配置,而不仅仅是模型。因此,应共同选择序数分类系统,以实现预测性能和稳定性。