论文

LLM 混淆了哪些值?基于施瓦茨的识别研究

Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study

模型评测模型能力评测

摘要

大语言模型 越来越多地通过它们认可的价值观进行评估,但这种评估的前提是模型可以识别具体情况下表达的价值。我们将这个先决条件研究为对施瓦茨十个基本价值观的受控顶级识别。我们的评估集包含 1,000 个俄语情景文本,在十个值之间进行平衡,并且每个项目由两名人工注释者独立标记。我们评估了 21 个指令调整的 LLM 在固定排名响应协议下的运行;语义面板的 20 次运行具有可靠的输出。合并后的 Acc@1 为 0.683,Acc@3 为 0.892,这表明模型通常会找到正确的动机区域,同时对相近的替代方案进行排名却不稳定。相邻值占语义错误的 50.9%,而在特定于检查点的空值下,这一比例为 24.4%。八个定向混淆在检查点和人工确认的子集中重复出现。有几种是强烈不对称的,包括普世主义与仁慈、传统与顺从、安全与权力,而刺激享乐主义形成了双向边界。它们的严重性是特定于检查点的,并且可能会影响高阶值配置文件。结果激发了价值识别评估,该评估结合了精确准确性、排序恢复和定向误差分析。