论文

采用预训练模型进行驾驶行为视频字幕的比较研究

Comparative study of adapting pre-trained models for driving behavior video captioning

模型评测模型能力评测

摘要

本报告对现有的一些微调和提示方法进行了检查和比较,并将其应用于自动驾驶领域。这个想法是通过在视频数据集上采用大语言模型(LLM)来比较这些方法。大语言模型非常擅长很好地理解不同形式的数据,这项研究旨在将对驾驶情况的低维理解引入到我们的主要测试模型 SpaceTimeGPT 中。 BDD-X(Berkeley DeepDrive eXplanation)数据集上的实验证明了完整微调框架在某些自动指标上的良好性能,并且在某些指标上甚至超过了基线。我们还尝试了低秩适应(LoRA)和 VideoLLaVA 模型的快速工程,并讨论了其局限性。