论文

基于GRPO的LLM Unlearning中奖励规范和基准可靠性的实证研究

An Empirical Study of Reward Specification and Benchmark Reliability in GRPO-based LLM Unlearning

模型评测模型训练模型编辑与遗忘鲁棒性、公平性与可信度评测

摘要

实用的 LLM 忘却通常通过两个目标来评估:抑制特定目标的知识和保留非目标效用。在生成式 QA 中,这使得第三种行为未指定:当目标相邻的提示承认更广泛的答案而没有特定于目标的泄漏时,模型应该在该级别回答,而不是泄漏、逃避或拒绝。我们在受控 LoRA-GRPO RWKU 设置中研究了这个规范问题,比较了四种奖励设计,包括词汇抑制、反拒绝塑造、基于标题的广泛回答和明确拒绝对比,有或没有 SFT 预热。实验表明,优化成功并不等于行为遗忘:RWKU 忘记分数、保留完成审核、终端训练采样轨迹审核和训练动态可以得出不同的结论。我们将这些分歧追溯到 奖励作弊 端点、GRPO 中的策略支持限制、错过端点更改的基准探针,以及在优化期间可以选择具有低语义泄漏的广泛主题答案的奖励。