论文
用作法官的决策模型中的对抗性线索:请求呈现的作用
Adversarial Cues in Decision Models Used as Judges: The Role of Request Presentation
摘要
即使较早的值与参考值匹配,被指示对最终承诺进行评分的答案法官也应该拒绝明显错误的最终值。我们证明,根据结构化评审请求的呈现方式,向候选人添加一个冒号可能会违反这一要求。数字参考证明了错误,并且配对干预将候选编辑与集成的呈现选择区分开来。在 200 个以前未使用的 DROP 和 GSM8K 源集群上,编辑将 Jev 的错误接受率从 1.0% 提高到 26.0%(使用三个输出标签),将 Jev 的错误接受率从 3.0% 提高到 26.5%(在排序 JSON 键下发布的四标签分级指令)。两种候选变体均在插入演示中被拒绝。尽管 Jev 在评分配置和演示中都达到了控制阈值,但这些交互仍然通过了预先指定的统计校正。大多数超额录取发生在数字错误较大的候选人中。 GPT-6 Sol 没有产生观察到的提示条件错误接受,缺失的响应尚未解决。结果 表明基本的判断能力可以与逻辑上等效的请求演示中固定候选人编辑的截然不同的脆弱性共存。参考感知语法和复合排序的变化限制了调查结果的操作范围,并使其内部原因无法衡量。