论文
Self-ReSET:学习从不安全推理轨迹中自我恢复
Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories
摘要
大型推理模型在通用领域具有卓越的自我修正能力;然而,在对抗性攻击下,他们经常难以从不安全的推理轨迹中恢复过来。现有的对齐方法试图通过对专家数据(包括反射跟踪或对抗性前缀)的模型进行微调来减轻此漏洞。至关重要的是,这些方法常常受到静态训练数据的阻碍,静态训练数据不可避免地偏离模型的动态、同策略推理轨迹,导致模型难以覆盖其巨大的生成空间并学习从自身的故障中恢复。为了弥补这一差距,我们提出了 Self-ReSET,这是一种纯粹的强化学习框架,旨在使 LRM 具有从自身安全错误轨迹中恢复的内在能力,随后将其重新用作强化学习的初始状态。跨各种 LRM 和基准的大量实验表明,Self-ReSET 显着增强了针对对抗性攻击的鲁棒性,特别是针对分发外 (OOD) 越狱提示,同时保持通用实用性以及高效的数据利用。进一步的分析表明,我们的方法有效地促进了自我恢复模式,使模型能够更好地识别不安全的中间错误状态并将其恢复到良性路径。我们的代码和数据可在 https://github.com/Ing1024/Self-ReSET 获取。