论文

LLM 输出可检测性和任务性能可联合优化

LLM Output Detectability and Task Performance Can be Jointly Optimized

模型训练偏好优化

摘要

检测机器生成的文本对于部署 LLM 时的透明度和问责制至关重要。水印通过偏置词元分布将可检测信号嵌入到 LLM 输出中,实现统计上可靠的检测。然而,据报道,带水印的 LLM 在下游任务上通常表现较差。我们提出了 PUPPET,这是一个通过 DPO 微调 LLM 的框架,以生成更容易被目标检测器检测到并且更好地执行下游任务的文本。我们使用两种奖励:输出机器类可能性的检测器和测量特定于任务的指标的评估器。正如水印通过其密钥进行验证一样,这种特定于检测器的设计可以让 LLM 提供商跟踪其已发布模型的使用情况。长篇 QA、摘要和论文写作的实验表明,使用 PUPPET 训练的 LLM 实现了与水印方法竞争的可检测性(即使在严格的低 FPR 下),同时在下游任务中表现优于它们。此外,这种优化仅需要几千个样本和 1--2 个 GPU 小时,并且其收益在域外任务、不同架构的六个检测器以及不同的 LLM 系列和大小中保持不变,甚至对释义攻击也具有鲁棒性。