论文
STONIC:LLM 价值分析的分层测量合约
STONIC: A Layered Measurement Contract for LLM Value Profiling
摘要
LLM 价值研究通常将问卷评分、成对选择和从生成文本推断的价值合并到一个配置文件中。该合并假设三个观察结果描述相同的稳定偏好。 STONIC 在来自 4 个银行和 35 个固定模型配置的 5,144 种情况下测试了这一假设。它比较了孤立评价的响应、在平衡冲突下做出的选择、自发答案以及模型自己的答案和编写的替代方案之间的后续选择。 17 种配置中的 10 种具有可用的行为数据,保留了跨银行的背书选择关系。 17 种符合条件的配置中的每一种都更喜欢自己较早的答案(中值效应 0.790),尽管选项位置会改变每种符合条件的配置中的选择率。轮廓形状从评级到冲突选择的转移最为强烈,而对于自发文本的转移则减弱。 200 个 L3 响应的三向注释提供了语义审核的任务局部检查:FULCRA 与大多数人最一致,而 DeBERTa 在校准后保留了有用的排名信息。隐藏状态比单独的提示更清楚地编码完成的决策。因此,这些模型显示了可重复的行为连续性,但证据并不支持跨界面的一种独立于评分者的价值认同。