论文

SignReasoner:通过功能结构单元理解复杂交通标志的组合推理

SignReasoner: Compositional Reasoning for Complex Traffic Sign Understanding via Functional Structure Units

模型训练强化学习

摘要

对复杂交通标志(包括布局复杂、多语言文本和复合符号的交通标志)的准确语义理解对于自动驾驶安全至关重要。当前的模型,无论是专门的小型模型还是大型视觉语言模型(VLM),都面临着一个重大瓶颈:缺乏组合泛化,导致在遇到新的符号配置时失败。为了克服这个问题,我们提出了 SignReasoner,这是一种将通用 VLM 转变为专家交通标志推理器的新颖范例。我们的核心创新是功能结构单元(FSU),它从常见的基于实例的建模转向灵活的基于函数的分解。通过将复杂的标志分解为最小的核心功能块(例如方向、通知、车道),我们的模型可以学习底层的结构语法,从而能够对未见过的组合进行稳健的泛化。我们将这种分解定义为 FSU 推理任务,并引入两级 VLM 后训练 管道以最大限度地提高性能:迭代描述-FSU 蒸馏,提高模型在 FSU 推理和描述生成方面的准确性; FSU-GRPO 使用树编辑距离 (TED) 计算 FSU 差异作为 GRPO 算法的奖励,提高推理能力。在新提出的 FSU-Reasoning 基准 TrafficSignEval 上进行的实验表明,SignReasoner 实现了新的 SOTA,具有显着的数据效率且无需架构修改,显着提高了各种 VLM 中对交通标志的理解。