论文

用于高效视觉推理的特定问题知识图

Question-Specific Knowledge Graphs for Efficient Visual Reasoning

模型训练强化学习

摘要

最近的视觉问答工作表明,视觉语言模型可以通过将视觉输入转化为文本表示来表现出强大的推理能力。这种翻译的有效性取决于视觉细节的保留程度;模型需要表现并调整足以支持推理的显性和隐性知识,而不引入虚假假设。利用详细图像标题的现有方法引入了与推理任务无关的视觉细节,增加了输入标记计数并增加了计算成本。为了应对这些挑战,我们提出了 VisKG,这是一种强化学习 (RL) 框架,其中模型学习将视觉内容转换为特定问题的知识图 (KG) 表示。该过程遵循最小充足信息原则,过滤掉感知噪声,同时保留思想链推理所需的实体关系结构。为了确保 RL 训练后稳定,VisKG 采用群体奖励解耦标准化策略优化(GDPO)。此外,我们用负理由样本加强了监督阶段,在 RL 后训练之前将模型暴露在错误的推理路径中。科学、数学和一般视觉理解基准的实验结果表明,VisKG 的性能与基线相当或更好,同时比基于标题的表示需要更少的标记。此外,使用 GDPO 训练 VisKG 的准确率平均比使用 GRPO 训练的 VisKG 提高了 2%。这些结果表明 KG 表示是一种支持多步骤推理的有前途的方法,并为未来为给定任务自适应选择最合适的表示开辟了道路。