论文

AgentDrive:面向自主系统中Agentic AI推理、含LLM生成场景的开放基准数据集

AgentDrive: An Open Benchmark Dataset for Agentic AI Reasoning with LLM-Generated Scenarios in Autonomous Systems

模型评测基准与评测资源

摘要

大语言模型(LLM)的快速发展引发了将其集成到自主系统中以实现推理驱动的感知、规划与决策的浓厚兴趣。然而,由于缺乏大规模、结构化且安全攸关的基准,评估和训练此类Agentic AI模型仍然困难重重。本文提出AgentDrive,一个包含300,000个LLM生成的驾驶场景的开放基准数据集,用于在多样条件下训练、微调和评估自主智能体。AgentDrive将场景空间形式化为七个正交轴上的因子化空间:场景类型、驾驶员行为、环境、道路布局、目标、难度和交通密度。LLM驱动的提示词到JSON管线生成语义丰富、可直接用于仿真的规格说明,并依据物理与模式约束进行校验。每个场景经过仿真推演、替代安全指标计算以及基于规则的结果标注。为补充基于仿真的评估,我们提出AgentDrive-MCQ,一个涵盖物理、政策、混合、场景与比较推理五个推理维度的100,000题多项选择基准。我们在AgentDrive-MCQ上对五十个领先LLM进行了大规模评估。结果显示,尽管专有前沿模型在上下文与政策推理方面表现最佳,先进开源模型在结构化与基于物理的推理方面正迅速缩小差距。我们在 https://github.com/maferrag/AgentDrive 发布了AgentDrive数据集、AgentDrive-MCQ基准、评估代码及相关材料。

AgentDrive:面向自主系统中Agentic AI推理、含LLM生成场景的开放基准数据集
图2:AgentDrive 框架:LLM 生成自动驾驶场景的端到端流水线。