论文

通用LLM作为人类驾驶行为模型:以简化汇入场景为例

General-purpose LLMs as Models of Human Driver Behavior: The Case of Simplified Merging

智能体系统Agent任务评测

摘要

人类行为模型在自动驾驶车辆(AV)的虚拟安全评估中作为行为参照与人类智能体模拟的载体不可或缺,但现有模型面临可解释性与灵活性之间的权衡。通用大语言模型(LLM)提供了一个有前景的替代方案:单一模型有望无需参数拟合即可部署于多样场景。然而,LLM能捕捉与不能捕捉人类驾驶行为的哪些方面仍知之甚少。为填补这一空白,我们将两个通用LLM(OpenAI o3与Google Gemini 2.5 Pro)作为独立闭环驾驶员智能体嵌入简化的单维汇入场景,并用定量与定性分析将其行为与人类数据对比。两个模型都再现了人类式的间歇性操作控制以及对空间线索的战术层依赖。然而,两者都不能一致地捕捉人类对动态速度线索的响应,且两模型的安全表现差异悬殊。系统的提示消融研究显示,提示组件扮演模型特定的归纳偏置角色,无法在LLM之间迁移。这些发现表明,通用LLM有望在AV评估流水线中充当独立、开箱即用的人类行为模型,但仍需后续研究以更好理解其失败模式,并确保其作为人类驾驶行为模型的有效性。

通用LLM作为人类驾驶行为模型:以简化汇入场景为例:论文配图
图 1:基于闭环零样本 LLM 的驾驶员代理框架。模拟器提供当前交互状态(顶部;一维合并场景),该状态被格式化为结构化提示,其中包括环境详细信息、短期历史记录、先前的加速计划、行为指南、战术规划指令和受限输出格式(左;参见表 II)。查询通用 LLM(o3 或 Gemini 2.5 Pro)以生成战术决策(合并与产出)、自然语言原理和固定范围加速计划(右),该计划在模拟器内的后退范围循环中执行。为了清楚起见,范围图标突出显示了一辆车辆的提示和输出;在每次试验中,两种车辆均由同一LLM的不同实例使用相同的提示变量进行独立控制,并进行镜像观察。