论文
因错误原因而正确的代码?验证 LLM 作为理论结构的测量工具
Correct codes for the wrong reasons? validating LLMs as measurement instruments for theoretical constructs
摘要
当 大语言模型 (LLM) 像人类注释者一样在文本中编码构造时,该协议使 LLM 成为可靠的编码器。然而,可靠性并未影响结构有效性。该工具可能是理论幼稚的,通过不满足构造理论提出的任何要求的相关性到达代码,并且除了真正的测量之外,没有当前的方法可以说明这一点。我们提出颗粒校准作为缩小差距的方法。它将一个结构分解为子句级组件,用提取的证据对文本进行测试,并通过明确的、理论衍生的规则组合结果。因为规则是陈述出来的,而不是放在一个不透明的通道中,所以它的结构是关于过程而不是输出的证据。它显示了哪些组件解决了代码,以及当代码错误时,是否缺少组件或相邻结构被误认为是组件。验证从根据注释器对仪器的输出进行评分,转变为显示仪器在其理论指定的构造上运行。