论文
用基于 AI 反馈的强化学习平衡城市交通控制中的多目标
Balancing Multiple Objectives in Urban Traffic Control with Reinforcement Learning from AI Feedback
摘要
奖励设计一直是现实世界强化学习(RL)部署的核心挑战之一,在多目标场景中尤甚。基于偏好的 RL 提供了一条有吸引力的替代路径,通过学习人类对成对行为结果的偏好。最近,基于 AI 反馈的强化学习(RLAIF)表明大语言模型(LLM)能够大规模生成偏好标签,减轻对人类标注者的依赖。然而,现有 RLAIF 工作通常只关注单目标任务,留下 RLAIF 如何处理涉及多目标的系统这一开放问题。在这类系统中,冲突目标之间的权衡难以指定,策略可能坍缩为只优化某个主导目标。本文探索将 RLAIF 范式扩展到多目标自适应系统。我们表明,多目标 RLAIF 能够产生反映不同用户优先级、实现均衡权衡的策略,而无需费力的奖励工程。我们认为,将 RLAIF 整合进多目标 RL,为目标固有冲突领域中的用户对齐策略学习提供了一条可扩展的路径。
