论文

LLM 法官和律师协会考官对泰国律师考试自由形式论文的两阶段稳定性研究

A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

模型评测模型能力评测

摘要

NLP 中的自由形式法律论文评估将专家评估者间稳定性视为单个上限数字,并将 LLM 法官与该上限的一致性视为法官稳定性的证据。我们通过相同的输入协议测试泰国律师考试的这两个假设:三名经过律师协会培训的考官(A、B、C)和一个 26-LLM 评审小组根据相同的四个输入(问题、官方律师协会评分规定、黄金答案、考生答案)对相同的 15 个交叉评分答案进行评分。标题的发现是不对称的。在 15 个单元格中,有 10 个单元格规定了两个轴,所有 29 名评估者都集中在一个紧密的范围内:面板协议是普遍的。在其余 5 个单元格中,如果评分细则没有规定如何对正确的最终答案进行评分,而忽略了决定性的法定引文,则人类小组将分为两个连贯的读数(B/C 多数位于评分较高的评分范围内,得分为 6-8;少数情况位于评分较低的评分范围内,评分为 1-2)。 LLM 评委群体的划分并不对称:26 个 LLM 中的 22 个得分处于或接近 B/C 的有争议的频段,3 个位于规则沉默的中间间隙,只有 1 个 (GPT-5.4 Nano) 接近 A 的频段,但没有在其中一致得分。我们的 26 名评审小组中的零 LLM 再现了少数人类对有争议的细胞的解读。 B/C 方向集群涵盖我们测试的每个型号尺寸、供应商和价格层。仪器化的三 LLM 锚子面板(Claude 4.6 Opus、Gemini 3.1 Pro、GPT-5.4 Pro)携带确定性探针、输入消融和引导 CI,并在 15 个细胞上达到锚面板 $α= 0.77$,与人类面板 $α= 0.36$ 相比。 LLM-面板 $α$ 较高反映了大多数读数的系统趋同,而不是两种读数的平衡再现;通过最大化与人类参考小组的一致性来选择其 LLM 判断的基准将通过构造继承这种不对称性。