论文
指令调谐LLM解码时真实性方法的对照研究
A Controlled Study of Decoding-Time Truthfulness Methods on Instruction-Tuned LLMs
摘要
解码时真实性方法(层对比解码、推理时干预和学习 logits 适配器)在应用于基础语言模型时,已证明在 TruthfulQA 上有 10-30 点的提升。然而,现代指令调整的 LLM 已经达到了更高的基线 (61-76%),这就提出了这些方法在实践中是否仍然有效的问题。我们设计了一个六控制评估框架——分布外训练、多评判验证、简单解码基线、混杂控制、引导置信区间和种子方差——并将其应用于 5 个模型 (1B-70B)、3 个基准测试和 15 种方法。我们发现,之前报告的增益在严格控制下大幅缩小:在完整的 TruthfulQA 基准 (N=817) 上,没有 词元级 方法实现统计上显着的改进,并且最好学习的适配器得分比贪婪低 -2.0 分 (p=.23)。我们确定了五种评估敏感性——污染、法官选择、基线缺失、混杂因素和统计噪声——它们单独或共同解释了这些差异。 HaluEval QA 和 TriviaQA 的交叉基准验证证实这些模式超出了 TruthfulQA 的范围。深思熟虑的提示方法(思维链、自我批评)在评估体系中显得更加稳健,CoT 在 无需训练 单遍方法的基准测试中实现了 +5.6-19pp。我们发布了七点评估清单,并讨论了对未来真实性研究的影响。