PlannerForge:用于自动驾驶中运动规划器基于场景的测试的 LLM 智能体
PlannerForge: LLM Agents for Scenario-Based Testing of Motion Planners in Autonomous Driving
摘要
确保自动驾驶的安全是一项严峻的挑战。基于场景的测试是一个用于验证自动驾驶系统 (ADS) 的系统化过程,但它仍然是一个支离破碎的模块化管道,其中场景生成、检索、修改、ADS 执行和结果分析是由单独的工具执行的,几乎没有交互。大型语言模型 (LLM) 智能体已在 ADS 子系统(例如感知、规划和控制)中显示出前景。然而,之前的工作还没有涵盖具有统一 LLM 智能体框架的 ADS 的整个基于场景的测试管道。我们推出了 PlannerForge,这是一个 LLM 智能体框架,它扩展了所有基于场景的测试阶段(从场景生成到 ADS 评估),并添加了两个进一步的 LLM 增强阶段:ADS 增强和 ADS 基准。我们使用 10 个现成的 LLM 在 5 个提示条件下评估 PlannerForge 的所有任务(生成、选择、修改、模块路由、规划器测试和增强)。每个任务的最佳得分范围为 0.88 到 1.00,开源 20-35B 后端在大多数任务上与商业 API 相匹配。 Qwen3.6:35B 等开源模型在五个任务中的三个上与商业 API 相匹配。端到端链接模块保留了 83% / 78% 的种子查询(商业/开放)。它在自然语言生成方面优于 Scenario Factory 2.0(Finkeldei 等人,2025)(193 个可执行文件与 200 个可执行文件中的 144 个),并实现了 92-96% 的所需城市、道路和车辆属性。它在 1 级选择上优于 BM25(Robertson 和 Zaragoza,2009)(92.0% vs. 67.5%),在物理有效编辑方面优于 From-Words-to-Collisions(Gao 等人,2025)(>=94% vs. 31%)。在 N=400 时,成本调整将规划器的成功率从 50.4% 提升到 70.2%,并将冲突从 19.0% 减少到 8.4%,而无需针对特定领域进行微调。