论文

MOCC-R1:增强多模态咨询回复的推理与回答一致性

MOCC-R1: Reinforcing Reasoning-Response Consistency for Multimodal Counselor Response Generation

模型训练强化学习

摘要

多模态咨询师回复生成旨在根据多模态对话历史生成适当回复。进展受两处缺口限制:现有数据集很少包含合格咨询师开展并由真人录制的持续咨询互动;现有方法也未显式优化咨询推理与生成回答的一致性,可能损害系统可靠性。因此,我们提出MOCC多模态咨询对话语料,含154名资质已核验咨询师参与的超过200小时互动。在此基础上提出两阶段框架MOCC-R1,以优化推理与回答一致性。冷启动监督微调训练模型生成结构化轨迹,包括理解来访者状态、将咨询原则连接到计划行动的回复意图,以及最终回答。随后强化学习奖励有依据的计划连贯性和计划执行,鼓励推断状态与计划获得对话上下文支持,并使回答实现计划。实验证明所提MOCC-R1有效。

MOCC-R1:增强多模态咨询回复的推理与回答一致性:论文配图
图1:(a)生成的心理咨询决策链可能同时存在状态—计划失配与计划—回答失配。(b)采用结构化监督微调或结果级GRPO后,推理与回答不一致的比例仍约为40%。