论文

ManGo:漫画主动叙事基础优化

ManGo: Manga Active Narrative Grounding Optimization

模型训练强化学习

摘要

漫画视觉问答需要模型来回答基于面板的视觉叙事的问题,其中相关证据分布在有序面板、嵌入文本、重复出现的字符和隐式事件转换中。这种结构使得被动页面编码不够充分,因为模型必须确定要检查哪些面板、要保留哪些线索以及何时积累的证据足以回答问题。我们提出了 ManGo(漫画主动叙事基础优化),这是一种用于主动漫画视觉问答的无监督框架。 ManGo 引入了主动叙事草图 (ANS),它会迭代选择面板,提取简洁的线索,并决定何时停止,在生成答案之前形成紧凑的问题导向证据草图。为了在没有人工注释答案或基本原理路径的情况下优化这种行为,ManGo 对多个 ANS 部署进行了采样,并应用了具有两种奖励的组相关训练:来自列表自排序的答案偏好和来自稳定有序面板轨迹的路径一致性。通过与群体相关的政策训练来优化组合奖励,鼓励模型改进最终答案和支持它们的小组级证据路径。标准漫画理解基准的实验表明,ManGo 在不同的设置下实现了最先进的性能。