论文
幼儿教育中日常活动图像的描述:基准和算法
Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm
摘要
早期儿童教育 (ECE) 的图像描述对于自动化活动理解和教育评估至关重要。然而,现有方法面临两个关键挑战。首先,缺乏大规模、特定领域的数据集限制了模型捕获 ECE 场景特有的细粒度语义概念的能力,导致描述笼统且不精确。其次,传统的训练范式在增强专业对象描述能力方面存在局限性,因为监督学习倾向于高频表达,而强化学习可能会遇到困难样本优化不稳定的问题。为了解决这些限制,我们引入了 ECAC,这是 ECE 日常活动图像描述的大型基准,由 256,121 张真实世界图像组成,并附有专家级描述和细粒度标签。 ECAC还配备了面向领域的评估协议——教学玩具识别分数(TTS),以明确衡量专业对象命名的准确性。此外,我们提出了 RSRS(强化学习和监督 微调 的奖励条件切换),这是一种在 RL 和监督优化之间动态交替的混合训练框架。通过将零奖励的硬样本重新路由到有监督的 微调,RSRS 有效地缓解了优势崩溃,并实现了细粒度识别的稳定优化。利用 ECAC 和 RSRS,我们开发了 KinderMM-Cap-3B,这是一种适应领域的多模态 大语言模型。大量实验表明,我们的模型实现了 51.06 的 TTS,大大优于最先进的基线,同时保持卓越的描述质量,凸显了其在专业教育应用中的潜力。