受限选项评分可能读到模型对另一个问题的回答
Scoring the Wrong Question: Readout Failures in Constrained-Option Evaluation
摘要
约束选项评分会读取模型对一组固定的允许答案的概率,因此即使模型要编写其他内容,它也会返回一个分数。我们研究了一个引用多项选择题的提示,以该题本身的答案指令结尾,并要求预测仅给出简短注释的读者模型是否会正确回答它。该模型可以开始回答引用的项目:在三个 Qwen3 检查点上,答案字母是几乎每一篇文章中最可能的标记,并且预测对读者的正确性与偶然性进行了无差别的排名。除了之前的 argmax 检查和预填充修复之外,我们还对声明的选项的支持、上下文中的第一个词元质量提供了无标签诊断;删除测试,追踪 Qwen3 答案字母开始到引用的指令;渲染和标记化检查是否有删除的分隔符和重合的第一个标记。预填充答案主干可将使用此提示评分的所有九个检查点上的中位选项质量从下方提升至二分之一以上,并且在选项和重整化不变的情况下,将 Qwen3 平均 AUC 从 0.4929 提高到 0.6152。 lm-polygraph 的默认 P(True) 估计器显示了相关的失败:它读取 True,其中 Qwen3 不考虑有利于答案字母 (MMLU) 或提示的 (A)/(B) 标签 (TriviaQA),并且其 Qwen3 平均 AUROC 与 MMLU 上的机会没有区别,而在 TriviaQA 上低于机会。在答案词干之后对 (A)/(B) 标签进行评分和重新规范化,将其提高到 0.632 和 0.868,对 True 与 False 进行重新规范化达到 0.660 和 0.860,并且在 TriviaQA 上都超过了所有 14 个默认的单答案库估计器。最初的预测也被重新规范化,但与机会没有区别:在没有标签的两种设置中,选项质量标记为低支持,并且仅检查预期目标显示哪个分数仍然排名。