论文
LaRA:用于检测 RL 中数据污染的分层表示分析 后训练
LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training
摘要
强化学习 (RL) 后训练 已证明可以改进 大语言模型 (LLM) 中的推理。然而,对于 RL 后训练 中的数据污染问题几乎没有探索,这可能会破坏训练过程本身的泛化和评估可靠性。现有的检测方法主要依赖于输出级信号,例如似然度或熵,这对于 RL 训练的模型来说变得不可靠,因为 RL 通过轨迹级奖励而不是词元似然来塑造行为。我们提出了 LaRA,一种分层表示分析框架,用于检测 RL 训练后 LLM 中的污染。 LaRA 引入了三个互补的指标,测量扰动灵敏度、方向崩溃和受控扰动下的局部表示刚性。我们发现污染会产生跨层渐进的几何偏差,包括放大的扰动敏感性、更强的方向塌陷和增强的局部刚度。根据我们的发现,我们还开发了一种污染检测协议,该协议可以聚合跨层和指标的表示级别偏差。对强化学习训练的推理模型进行的实验表明,我们的协议优于现有的污染检测输出级基线。