论文
CRAFT:从反事实预测到真实交互的驾驶策略强化微调
CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies
摘要
开环模仿学习先进了现代自动驾驶策略架构,但闭环部署仍然容易受到策略引起的分配转移的影响。现有的 后训练 范式表现出基本的权衡:闭环 RL 微调 提供来自执行操作的实际执行反馈,但受到信息事件稀疏性的限制,而反事实 微调 提供对候选未来的密集监督,但继承了不完美的未来估计的偏差。我们引入了 Counterfactual-to-Interactive Reinforcement 微调 (CRAFT),这是一个 同策略 框架,它将闭环 后训练 制定为代理残差优化。 CRAFT 使用群体归一化反事实优势作为真实闭环优势的密集代理,并通过交互关键事件的基于真实交互的残差校正将该代理与闭环世界保持一致。为了稳定适应,CRAFT 通过非对称 KL 自 蒸馏 规范了针对 EMA 教师的在线策略。理论上,CRAFT 将真实的闭环策略梯度分解为相同访问状态分布下的代理项和残差项,从而减少对齐代理的残差方差,同时通过基于真实交互的残差近似减轻代理偏差。根据经验,CRAFT 在 Bench2Drive 上跨层次规划、视觉-语言-动作和词汇评分架构实现了最强的闭环增益。消融、缩放行为、稳定性分析和转移结果进一步验证了密集反事实代理和基于真实交互的残差校正的互补作用。项目页面:https://currychen77.github.io/CRAFT。