论文
SKG-VLA:面向结构化场景语义与多模态推理决策的场景知识图谱先验
SKG-VLA: Scene Knowledge Graph Priors for Structured Scene Semantics and Multimodal Reasoning for Decision Making
摘要
大规模投诉处理系统中的决策越来越依赖于异构证据,包括投诉叙述、屏幕截图、订单元数据、历史交互和平台政策。现有的投诉理解系统主要对孤立的模态进行浅层分类或模板匹配,而没有充分利用显式场景结构、规则知识和交叉证据依赖关系。为了解决这一限制,我们提出了用于多模态投诉决策的 SKG-VLA。其核心思想是将每个案例建模为结构化的投诉场景,并用场景知识图(SKG)表示其与决策相关的语义,它将投诉实体、证据项、政策条款、时间事件、事务状态和操作相关关系组织成一个统一的图。基于SKG,我们构建了一个数据合成管道,可以生成投诉场景描述、规则一致的图概括、问答监督和决策建议。我们进一步构建了一个具有纯文本和多模态域内基准的大规模投诉场景数据集。最后,我们采用三阶段训练策略——领域自适应预训练、面向任务的指令微调和端到端多模态对齐——将结构化场景先验注入多模态决策模型。实验表明,SKG-VLA 持续改进了基于策略的推理、投诉决策准确性、长尾泛化以及不完整证据下的鲁棒性。
