论文

TRIP-Evaluate:用于评估交通运输大型模型的开放多式联运基准

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

模型评测基准与评测资源

摘要

大语言模型 (LLM) 和多式联运大型模型 (MLLM) 越来越多地用于监管问答、交通管理支持、工程审查和自动驾驶场景推理等交通任务。然而,运输工作流程是规则密集型、计算密集型、安全关键型且本质上是多模式的。现有的通用基准对于模型是否能够正确应用法规、执行可验证的工程计算或可靠地解释交通场景提供的证据有限,而少数公共交通基准的范围仍然很窄,很少支持跨文本、图像和点云数据的细粒度诊断。为了解决这一差距,我们推出了 TRIP-Evaluate,这是一个针对大型运输模型的开放式多式联运基准。该基准使用角色-任务-知识分类法组织 837 个项目,涵盖车辆、交通管理、旅行者以及规划和设计功能。每个项目都标有功能、模式和难度标签,从而能够进行从整体准确性到特定故障模式的诊断。当前版本包括 596 个文本项、198 个图像项和 43 个点云项。 TRIP-Evaluate 还标准化了项目构建、质量控制、提示、解码和评分,以提高跨模型可比性。各种模型的结果表明,基于文本的性能正在改善,但在多步骤工程计算、规则约束推理、多模态场景理解和点云理解方面仍然存在重大弱点。总体而言,TRIP-Evaluate 为交通应用中的模型选择、回归测试和更安全的部署提供了可重复、可诊断且符合工程设计的评估基线。