论文
HARVE:针对稳健奖励模型的黑客感知奖励头向量编辑
HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models
摘要
奖励模型是 大语言模型 (LLM) 对齐的核心,但它们仍然容易受到 奖励作弊 的影响。为了评估奖励模型的稳健性,我们引入了包含 13 个 奖励作弊 模式的 RewardHackBench,涵盖现实生活中的高风险领域和一般设置,并且我们发现八个奖励模型的特定子类别存在严重失败。为了减轻这些失败,我们提出了 HARVE,一种用于标量奖励模型的 无需训练 奖励头编辑方法。 HARVE 不是奖励模型 微调,而是从与所选黑客子类别相关的剩余流方向识别多向黑客子空间,并删除与该子空间对齐的奖励头向量的分量。这直接降低了奖励头对黑客相关功能的敏感度,仅使用一小组对比标准奖励作弊示例,无需梯度更新或 微调。八个奖励模型的综合实验表明,\model 提高了对奖励作弊的鲁棒性,优于 微调 基线,并保留了奖励模型的一般能力。进一步的分析表明,奖励作弊 作为多维残差空间结构比通过孤立的表面线索更好地捕获。