论文
由失效信息驱动的图像自增强支持多模态LLM自我改进
Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement
摘要
多模态大语言模型(MLLM)在视觉-语言任务上取得了显著性能,但其进展依赖于大规模、高质量的多模态数据,这些数据成本高昂且难以标注。自我增强提供了一种有希望的替代方案,允许模型通过自身训练数据扩展,而无需外部监督。然而,现有的MLLM自我增强方法大多基于文本,而图像增强尚未充分探索,通常依赖于通用或手工编写的变换,这些变换与模型的实际能力不匹配。我们提出Failure-informed Image Self-Augmentation(FISA),这是一种用于MLLM自我提升的框架,从模型自身失败案例中生成增强图像。我们的方法生成具有挑战性但答案保留的视觉问题,通过自我审查验证其实用性,并使用双重保真度过滤器避免语义扭曲。在视觉问答基准上的实验表明,提出的方案在分布内和分布外设置上均能持续提升性能。进一步的实验验证了FISA与现有文本自增强方法的兼容性,合成样本的数据效率优于通用图像增强基准,以及提出的过滤策略的实际有效性。
