论文

可复现不等于构念有效:用LLM测量制度情境中的表达

Reproducibility is not construct validity: LLM measurement of institutionally situated communication

模型评测鲁棒性、公平性与可信度评测

摘要

高度可重复的标注不一定意味着LLM推断指标捕捉到了其目标构念。我们使用欧盟委员会AI法案咨询数据,将同一利益相关方的结构化问卷回答与自由文本意见关联,检验这一区别。LLM对咨询文本的标注高度可重复(组内相关系数大于0.99),但与其意图近似的同名问卷指标收敛有限。问卷与文本推断指标的偏差在不同群体间呈系统差异:商业协会在文本咨询中表达的AI风险担忧高于问卷(g=+1.0),公共机构和若干非商业群体则偏差较小或为负。得分差异在欧洲国家间呈正空间自相关(Moran’s I=0.347,p=0.036),说明邻国利益相关方在文本中对AI安全担忧的立场更相似。尽管存在偏差,在各偏差水平下,问卷报告的担忧仍与支持可解释性强相关。结果表明LLM标注的可重复性可以与较差构念对应并存,因此将LLM作为测量工具时,需要区分可重复性、构念有效性和沟通情境变化。