论文
C2F-Thinker:通过提示引导强化学习进行多模态情感分析的粗到细推理
C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis
摘要
多模态情感分析旨在整合文本、听觉和视觉信息,以实现深入的情感理解。尽管多模态 大语言模型 (MLLM) 通过监督 微调 取得了进展,但它们的“黑匣子”性质阻碍了可解释性。虽然思想链 (CoT) 推理提供了一种潜在的补救措施,但它受到高昂的手动注释成本和强化学习 (RL) 固有挑战的限制,例如奖励稀疏和硬样本探索效率低。本文提出了 C2F-Thinker,这是一个通过两阶段渐进训练管道将粗到精结构化推理与提示引导 RL 相协调的框架。在第一阶段,我们使用从更大的教师模型中提取的高质量 CoT 数据进行冷启动监督 微调,包括三个不同的阶段:极性判断、中间分析和细粒度评分。这为基本模型配备了结构化的情感推理范式。在第二阶段,我们引入了提示引导的组相对策略优化(GRPO)算法。通过在采样过程中注入正确的初始极性预测作为提示,引导模型走向准确的推理路径,有效减轻级联错误并提高硬样本的利用率。此外,结合分类、回归和格式化约束的多方面奖励函数旨在提高预测准确性,同时保留可解释性。实验结果表明,C2F-Thinker 在细粒度情感回归任务上实现了有竞争力的性能,同时在跨域泛化方面显着优于基线。这凸显了它在为现实应用程序构建值得信赖且强大的情感分析系统方面的潜力。