论文
LLM 公平性的现场行为评估,而非标准化测试分数
In-Situ Behavioral Evaluation for LLM Fairness, Not Standardized-Test Scores
摘要
LLM 公平性应该通过现场行为模式而不是标准化测试问答基准来评估。我们表明,标准化测试范式在结构上可能是不可靠的:表面层的提示构造选择虽然与正在测试的公平性问题完全正交,但占了大部分分数方差,在方向和幅度上改变了公平性结论,并导致模型排名严重不一致。我们开发了 MAC-Fairness,这是一个将受控变化因素嵌入到现场行为评估中的框架,研究当身份变化作为自然多智能体对话的一部分时,模型的不同处理行为如何变化。将标准化测试问题重新用作对话种子而不是评估工具,我们评估了跨越多个模型和身份存在配置的 800 万个对话记录中的立场持久性(从自我角度来看,他们如何持有立场)和同伴接受性(从其他角度来看,他们对同伴的接受程度)的模型内差异。现场行为评估揭示了稳定的、特定于模型的、不同处理的行为特征,这些行为特征可以在不同的公平基准上进行概括,这是标准化测试范式无法提供的一种证据形式。