论文
从封面来看:清理 LLM 真实性基准以避免表面级特征泄漏
Judging by the Cover: Cleaning LLM Truthfulness Benchmarks to Avoid Surface-Level Feature Leakage
摘要
二元选择真值基准要求模型在正确和错误答案之间进行选择,但如果这两个答案在表面特征上存在系统性差异,则模型可能会超出机会而无法执行预期的推理。我们证明这种故障模式是可检测的,并且可以被下游分类器利用。在 TruthfulQA 中,一个简单的六特征逻辑分类器在区分正确答案和错误答案方面实现了相当高的准确性。我们进一步表明,其他基准测试中也存在类似的表面级伪影。为了解决这个问题,我们开发了一种通用机制,通过去除泄漏最多的增强对来清洁它们。我们发布了 TruthfulQA 的一个版本,其表面特征泄漏几乎减少了,并提供了一种审核-剪枝机制,以便可以在发布之前清理数据集。