论文

更多选择,更少决策:类 JEV 直接决策模型中的序数尺度偏差

More Choices, Fewer Decisions: Ordinal-Scale Bias in JEV-like Direct-Decision Models

模型评测模型推理判别式推理与决策模型行为与机制分析Jev

摘要

直接决策模型将文本转换为低延迟结构化标签和分数,使其对分类和自动评估具有吸引力。然而,可靠性要求的不仅仅是准确性:模型还必须忠实地使用用户提供的顺序决策量表。我们分析了JEV~1.13和三个开放的KEV模型。我们的调查从 ANLI 开始,其中 JEV 将所有预测的 38.8% 和 51.3% 的错误分配给中性,尽管准确度为 74.95%、接近平衡的黄金标签和平衡的候选位置。在 36 个有序数据集中,最终决策仅使用 67--76% 的有效黄金支持,而在四个名义任务上则使用 87--102%。随机化候选顺序会削弱但不会消除这种压缩。保持项目和源分数固定,同时平衡黄金支持和头寸,我们将规模从 $K=2$ 细化到 $14$;每个模型的利用率都会下降,在 $K=14$ 时达到 26--75%,尽管大多数模型的候选概率仍然很广泛。有针对性的 BA-LoRA 后训练将两种 KEV 大小的八个监督尺度上的黄金相对利用率从大约 47% 提高到 86%,这表明压缩是学习的和可修改的,而不是不可变的架构限制。我们称之为序数尺度利用偏差:决策阶段候选空间压缩与准确性、黄金不平衡、固定位置和单独的候选计数不同。代码和数据可在 https://github.com/Glax147/jev_ordinal_scale_bia 获取