论文
StochasT:利用随机转弯深度学习进行视觉指令调整
StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning
摘要
大型视觉语言模型 (LVLM) 广泛依赖视觉指令调整 (VIT) 来激发其多模态推理能力。然而,我们发现了一个差异:VIT 通常会针对同一图像打包多个语言任务以进行对话式、多轮训练,而现有基准测试则在孤立的、单轮场景中评估 LVLM。这些模型在多轮训练过程中可能会出现视觉注意力衰减和上下文过度拟合的问题,这使得它们很难在不匹配的测试阶段充分发挥其潜力。为了缩小差距,我们建议使用随机转弯深度(StochasT)进行学习,它将同一图像的语言任务随机分组为不同大小(转弯深度)的集群,同时保留其有机顺序。因此,虽然 StochasT 利用了 ResNet 的 Dropout 和随机深度,但它实际上并没有丢弃任何东西来最大化训练数据的效用。此外,我们引入了一种基于平衡拉丁方的具有挑战性的、与基准无关的评估机制,以衡量 LVLM 在不同上下文依赖性下的稳健性。大量实验表明,StochasT 有效地为 LVLM 提供了针对单轮和多轮用例的强大、协调的功能。