论文
用于指令调整的统一道德价值数据集
A Unified Moral-Value Dataset for Instruction Tuning
摘要
大语言模型(LLM)发展迅速,成为日常生活中有价值的工具。然而,如何使 LLM 与一组特定的人类价值观保持一致仍然是一个悬而未决的问题。最近的研究表明,指令调优对于零样本任务具有强大的潜力,并且可以作为解决价值对齐问题的有效方法。然而,尽管已经存在许多用于指令调整的数据集,但它们并不是专门围绕道德场景和行为设计的。我们构建了一个统一的道德价值数据集,可以直接用于指令调整。该数据集建立在现有道德价值数据集的基础上,将它们合并到统一的语料库中并将其转换为指令响应格式。我们表明,对将一般任务数据集与我们的数据集相结合的混合数据集进行训练可以保留一般任务性能,并且我们报告了关于混合比率如何影响面向价值的任务性能的初步观察。我们的工作为指令调整提供了道德价值数据集,并为进一步的对齐研究提供了有用的资源。该数据集可从 https://huggingface.co/datasets/teohzzh/value-for-instruction-tuning 获取。