论文
RUBAS:基于规则的强化学习以确保代理安全
RUBAS: Rubric-Based Reinforcement Learning for Agent Safety
摘要
LLM 演变为支持工具的代理,带来了与现实世界执行相关的新一类安全挑战,而不是简单的文本生成。现有的对齐方法通常依赖于粗略拒绝信号或静态监督,因此很难在安全性与跨不同代理风险的有用工具执行之间取得平衡。我们介绍 RUBAS,一个基于规则的强化学习框架,用于代理安全。 RUBAS 将智能体行为分解为四个维度:工具使用安全性、争论安全性、响应安全性和帮助性。这些结构化的规则在完整的代理轨迹上提供了细粒度和可解释的奖励,使强化学习能够优化安全工具的使用,同时保持任务的完成。跨多个代理安全基准和模型的大量实验表明,RUBAS 提高了标准对齐基线的安全性,减少了基于工具的幻觉,并保持了竞争性效用。我们的结果表明,多维标题奖励为在安全关键工具使用环境中调整 LLM 代理提供了有效的训练信号。