论文

ToSCA:利用分层强化学习来处理会话代理的时间和策略抽象

ToSCA: Leveraging Hierarchical Reinforcement Learning on Temporal and Strategic Abstractions of Conversational Agents

模型训练强化学习Agentic RL

摘要

人类在推理和交互中自然地表现出多种形式的抽象,包括跨决策时间尺度的时间抽象和对交流意图的战略抽象。受这些互补抽象的启发,我们提出了一个用于会话代理的两级分层强化学习(HRL)框架,它弥补了现有 词元级 和话语级 RL 方法之间的差距。我们的框架建立在两级马尔可夫决策过程 (MDP) 的基础上,以显式文本策略表示的话语级操作为 词元级 响应生成提供条件。基于理论分析和效率考虑,我们采用 DQN 来优化高层 Q 网络,并采用 PPO 来训练低层 actor-critic。为了进一步缓解奖励稀疏性并促进收敛,我们引入了一种双粒度奖励机制,该机制将话语级满意度得分与 词元级 内在自洽性和 KL 散度惩罚相结合。对日常生活和情感支持对话的实验表明,我们的方法在策略确定和响应质量方面始终优于各种基线。我们的实现可以在 https://github.com/AaronJi/ToSCA 上找到。