论文
当模型意见不一:重新思考公众意见分析中的LLM评估
When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis
摘要
联邦机构正在部署大语言模型(Large Language Model,LLM)对公众意见语料进行分类,模型对档案的组织方式决定了政策制定者能看到什么、哪些论点能被注意到。以小型验证集上的立场准确率为锚点的标准评估,无法检测出不同模型对同一公众输入产生实质性不同分类的情形。我们提出一种解释性审计流水线(Interpretive Audit Pipeline),将多模型分歧视为解释复杂性的诊断信号,并把人工复核引导到真正模糊的公众输入上。通过分析美国农业部(USDA)某联邦公示案卷上的1,260条公众意见(横跨四个LLM),我们发现模型间的主题分歧超过模型内的提示词差异,且专家评分细则会压制而非消解深层的解释性分歧。在一个对分层抽取的40条意见子样本开展的两阶段标注研究中,四个LLM与一名人类标注者先独立标注,随后在看到彼此的标签后进行修订。各标注者的修订行为各不相同,而且人类标注者的修订常常引入模型集成集体输出中不存在的表述框架。我们主张,对于LLM辅助的解释性编码而言,基于分歧的评估是准确性指标的必要补充。
