论文
超越 Shapley:用于 LLM 对齐和评估的基于影响力的数据审核管道
Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation
摘要
大语言模型(LLM)的对齐越来越受到数据质量的瓶颈。随着数据集规模的扩大,大量的偏好和指令调整语料库不可避免地会积累隐藏的结构性矛盾、安全风险和系统性的人工注释错误。标准数据集审核方法(例如语义重复数据删除或 LLM-as-a-judge)很难捕获单个记录的实际预测影响,并且经常会错过深层的功能规则冲突。为了解决这个问题,我们引入了一个可扩展的、仅推理的数据评估管道,它可以近似 Shapley 值,而无需迭代模型重新训练。通过将语义 k-NN 邻域映射到有向图中,我们的框架使用零样本和单样本条件对数似然偏移,通过参考 LLM 的概率分布直接评估数据效用。然后,我们的管道将这些预测影响力得分转换为局部优势指标,以隔离梯度冲突的记录。我们展示了该管道在清理两个经过严格审查的对齐数据集方面的功效。首先,将我们的管道应用于 HelpSteer2 数据集将手动审计搜索空间减少了 99.1%,成功地发现了各种故障模式中的错误标记记录。其次,将我们的自动化审计策略应用于 Anthropic 的 HH-RLHF 训练和评估分割,发现了数千个隐藏的安全和事实偏好倒置。至关重要的是,通过将此审计扩展到评估分割,我们暴露了当前基准完整性中的严重漏洞:高性能模型经常预测更安全或更有用的响应,只会受到客观有缺陷的人类 真值 标签的惩罚。总体而言,我们的工作提供了一种以数学为基础的高效诊断工具,用于发现人类标签故障、清理评估基准并确保 LLM 比对数据的完整性。