论文

面向网约车裁责的渐进式视觉-逻辑对齐框架

A Progressive Visual-Logic-Aligned Framework for Ride-Hailing Adjudication

模型训练强化学习

摘要

高效裁断责任纠纷对维护市场公平至关重要。然而,网约车订单量的指数级增长使人工审核难以为继,而传统自动化方法缺乏准司法裁决所需的推理透明度。尽管多模态 LLM 提供了有前景的范式,它们从根本上难以弥合通用视觉语义与严格证据规程之间的鸿沟,常导致感知幻觉与逻辑松散。为解决这些系统性错位,我们提出 RideJudge,一个渐进式视觉-逻辑对齐框架。我们不依赖通用预训练,而是通过 SynTraj——一个将抽象责任概念落地为具体轨迹模式的合成引擎——来弥合语义鸿沟。为解决海量法规与有限上下文窗口之间的冲突,我们提出蒸馏专家知识的自适应上下文优化策略,并辅以裁断链(Chain-of-Adjudication)机制以强制进行主动的证据查究。此外,针对稀疏二元反馈难以胜任复杂责任评估的问题,我们实现了一种新颖的序数敏感强化学习机制,依据层级化严重程度校准决策边界。大量实验表明,我们的 RideJudge-8B 达到 88.41% 的准确率,超越 32B 规模基线,为可解释裁断树立了新标准。

面向网约车裁责的渐进式视觉-逻辑对齐框架:论文配图
图 1. 该流程由三个关键阶段组成:(1) 自动数据合成(第 3 节),它通过两个专用模块弥合领域差距:用于视觉语言对齐的 SynTraj 构建和用于逻辑推理重建的判断链合成; (2) 知识感知上下文细化(第 4 节),能够进行动态规则修剪和专家先例提取; (3) 渐进式司法对齐(第 5 节),一种多阶段训练范式,最终形成操作系统奖励的强化学习,以实现精确的决策边界对齐。