论文

连接推理和行动:用于高效跨域任务导向对话的混合 LLM-RL 框架

Bridging Reasoning and Action: Hybrid LLM-RL Framework for Efficient Cross-Domain Task-Oriented Dialogue

模型训练强化学习

摘要

跨领域的面向任务的对话需要对隐式和显式的可行性约束进行推理,同时规划长期、多轮的行动。 大语言模型 (LLM) 可以推断出此类约束,但在长期范围内不可靠,而强化学习 (RL) 优化了长期行为,但无法从原始对话中恢复约束。因此,天真地将 LLM 与 RL 耦合是脆弱的:未经验证或非结构化的 LLM 输出可能会破坏状态表示并误导策略学习。受此启发,我们提出了 Verified LLM-Knowledgepowered RL (VLK-RL),这是一种混合框架,使 LLM 派生的约束推理可用于 RL。 VLK-RL 首先使用 LLM 引出候选约束,然后通过双角色交叉检查程序验证它们,以抑制幻觉和交叉转弯不一致。经过验证的约束被映射到本体对齐的槽值表示中,从而为 RL 策略优化产生结构化的、约束感知的状态。跨多个基准的实验表明,VLK-RL 显着提高了泛化性和鲁棒性,在长期任务上优于强大的单模型基线。