论文
UniIntervene++:高效真实世界RL的自适应干预智能体
UniIntervene++: An Adaptive Intervention Agent for Efficient Real-World Reinforcement Learning
摘要
在线强化学习(RL)让机器人策略经物理交互改进,但其所需辅助随能力演化而变化。基于离线估计或固定决策规则的既有干预策略因此可能与当前策略失配。为此我们提出UniIntervene++——学习在在线RL期间把控制分配于自主执行与异构辅助行为之间的自适应干预智能体:先把演化的RL策略、轨迹校正与任务结构化CodePolicy形式化为统一半马尔可夫决策过程中的选项并在线学习其相对价值;能力自适应干预周期性经无辅助执行探测RL策略,使控制分配响应其演化能力;耦合经验学习让辅助行为改进RL策略,其演化结果又重塑未来干预决策。由此UniIntervene++联合决定何时干预、如何干预、以及随RL策略改进何时归还控制。五个真实操作任务上,UniIntervene++平均成功率89.67%、至少领先全部基线6个百分点,同时把人工干预降到0.77%——较最佳基线相对至少减少94.6%。代码/项目页:https://github.com/dannyyudong/An-Adaptive-Intervention-Agent-for-Efficient-Real-World-Reinforcement-Learning。