论文

GAPL:基于 LLM 的轨迹规划的扎根行动效果政策学习

GAPL: Grounded Action-effect Policy Learning for LLM-Based Trajectory Planning

智能体系统Agent 架构与控制循环

摘要

自动驾驶的轨迹规划既需要高层推理,又需要精确的底层控制。 大语言模型 (LLM) 提供丰富语义的规划功能,但其应用受到幻觉推理、环境动力学基础较差以及控制数值精度有限的限制。我们提出了 GAPL(基于环境验证的动作效果策略学习),这是一个统一的框架,它将基于 LLM 的效果估计、基于模拟的效果环境核验和策略优化集成到闭环系统中。 GAPL由三个模块组成:(1)基于LLM的效果评估器,用于结构化多维行动效果评估; (2) 基于模拟的效果核验模块,可预测模拟器预测轨迹的动态一致效果; (3) 效果感知决策器,通过蒸馏器将 LLM 效果估计与模拟结合起来,以指导基于近端策略优化 (PPO) 的策略学习。对四种 Highway-env 场景的实验表明,GAPL 始终优于基线,碰撞率、平均位移误差 (ADE) 和最终位移误差 (FDE) 平均降低了 {0.76, 0.86, 2.00},平均奖励增益为 1.44。