论文
强化学习的鲁棒通用实用程序
Robust General Utility for Reinforcement Learning
摘要
具有通用效用的强化学习 (RL) 通过优化策略引发的占用度量的任意效用函数来扩展经典 RL,从而实现更广泛的应用。然而,之前关于通用效用强化学习的工作通常假设评估效用是固定的并且正确指定的。在实践中,部署时使用的实用程序可能与训练时使用的实用程序有所不同,从而造成了先前工作无法解决的鲁棒性差距。受此启发,我们提出了强大的通用效用强化学习,这是一种极小极大学习框架,可以在规定的不确定性集中训练针对效用错误指定的策略。我们的框架严格概括了标准通用强化学习,同时还通过适当选择效用不确定性集,提供了许多现有强化学习框架的统一视图,包括奖励鲁棒强化学习和约束强化学习。我们进一步开发了两种机制的可证明收敛的随机算法。对于凹效用,我们开发了一种预测随机梯度下降-上升方法并建立平稳性保证。对于更具挑战性的非凹机制,我们提出了一种随机近似外梯度算法,该算法可以减轻非凹性引起的不适定行为,并保证收敛到近似一阶平稳性。 LLM 安全对齐和探索最大化任务的实验进一步证实了收敛行为与我们的理论一致。