论文
超越价值基准:通过对称 Q 排序测量 大语言模型 中的价值结构一致性
Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts
摘要
大语言模型 (LLM) 越来越多地部署在需要复杂道德推理和价值权衡的环境中。然而,现有的评估通常依赖于项目级的行为指标,无法捕捉模型如何在结构上优先考虑竞争价值作为一个有凝聚力的系统。为了解决这个问题,我们提出了一个基于 Q 方法的对称人类 LLM 评估框架,以衡量价值结构的一致性。根据我们的协议,人类和模型将相同的 140 项道德陈述排序为共享的九列强制分布;对于 LLM,我们得出严格的排名并确定地将它们映射到 Q 排序桶。使用人类参考样本 ($N=35$),我们建立了特定于该仪器和样本的稳定的三因素参考几何结构。我们在两个温度设置下通过 240 个重复的 Q 排序评估了四个模型家族中的 12 个 LLM,通过 Procrustes 相似性 ($φ$) 和基于 RSA 的 Spearman 相关性 ($ρ$) 量化结构对齐。我们的结果揭示了显着的跨家庭异质性、模型对世代随机性的敏感性和局部失调,这表明有利的全局分数可以掩盖潜在的区域扭曲。虽然基于排名和基于桶的分析保持高度一致,但提示措辞引入了显着的差异。最终,评估价值结构一致性为传统的逐项道德基准提供了重要的结构补充。