论文
DrivingBench:视觉语言模型可以驾驶丰田卡罗拉吗?
DrivingBench: Can Vision-Language Models Drive a Toyota Corolla?
摘要
Frontier 模型在许多数字基准测试中表现出色,但它们驾驶真实汽车的能力(一项人类日常技能)在很大程度上尚未经过测试。据我们所知,我们推出了 DrivingBench,这是通用视觉语言模型必须驱动真实汽车的第一个基准。通过三个工具,模型可以看到丰田卡罗拉的摄像头帧,并直接控制其在停车场锥体路线上低速行驶的转向和速度。当模型思考并且新命令取代当前正在运行的命令时,汽车可能会继续行驶,因此推理延迟是任务的一部分,测试模型在此类约束下观察、行动、监控、恢复和完成长期目标的能力。我们在供应商原生工具(Codex、Claude Code、Cursor)中对 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6 进行基准测试,在一次对话中每次尝试最多 3 次; Astra 是唯一在第二次尝试中完成该路线的车型,没有其他尝试通过 50% 的路线。四个模型中的两个在保留上下文的尝试中得到了实质性改进。我们还详细介绍了操作界面背后的设计原则,并展示了工具输出格式和任务框架如何结合起来确定模型是否会开车或拒绝。我们通过视频和遥测技术发布我们的Harness、提示、路线图和轨迹,以实现可重复性。