论文

D2VBench:在日常场景中对 大语言模型 进行价值困境基准测试

D2VBench: Benchmarking Large Language Models with Value Dilemmas in Daily Scenarios

模型评测基准与评测资源

摘要

随着大语言模型(LLM)在现实场景中的广泛应用,其输出的价值含义至关重要。然而,现有的评估基准缺乏对日常场景中涉及多重价值冲突的价值困境的覆盖,且评估形式过于简单化,无法评估LLM的价值一致性。为了解决这些问题,我们提出了 D2VBench,这是一个价值对齐基准,由 LLM 和人类之间的多阶段协作构建的 10,000 个真实日常困境场景实例组成,以 158 个手动注释的细粒度价值概念为基础。为了对基准进行评估,我们提出了一种混合评估范式,将多项选择问题与开放式问题相结合。我们对八款主流LLM进行综合评测。实验结果表明,D2VBench具有较高的可靠性和鲁棒性,有效反映了LLM在不同价值类别和维度上的对齐情况,为价值对齐研究提供了更真实、更细粒度的工具。该数据集可从 https://github.com/tjunlp-lab/D2VBench 获取。