论文

MCJudgeBench:多约束指令跟踪中约束级法官评估的基准

MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following

模型评测基准与评测资源

摘要

多约束指令遵循需要验证响应是否满足多个单独的要求,而 LLM 法官通常仅通过整体响应判断来评估。我们引入了 MCJudgeBench,它是多约束指令跟踪中约束级判断评估的基准。每个实例包括指令、候选响应、显式约束列表、{yes、partial、no} 中的每个约束黄金标签以及受控响应端扰动。评估协议还包括评估提示变体以测试判断稳定性。我们使用正确性和不一致性指标来评估专有和开源 LLM 判断,区分随机解码下的内在不一致和提示和响应扰动下的程序不一致。我们的结果表明,判断可靠性具有多个维度:强大的整体性能并不能保证跨标签类别的检测同样可靠,特别是对于罕见的部分案例和无案例。正确性较高的判断并不总是不一致的情况较低。推理评估提高了正确性,但并不能统一提高稳定性。这些发现激励在约束水平上评估 LLM 判断来研究这些故障模式。