论文

通过认知状态转换优化主动对话策略

Proactive Dialogue Policy Optimization via Cognitive-State Transition

模型训练强化学习Agentic RL

摘要

主动对话要求Agent不断根据用户反馈调整其策略,同时在多个轮次中逐步实现任务目标。为了超越静态数据集的模仿学习,最近的方法使用用户模拟器来收集交互式数据以进行策略优化。然而,许多模拟器没有明确地模拟用户认知的演变,从而限制了各轮反馈的一致性和状态依赖性。此外,仅通过高级策略标签来表示每个动作会忽略较大的话语空间,并且无法区分同一策略的替代实现。为此,我们联合设计了一个$\textbf{Cog}$nitive User $\textbf{Sim}$ulator $\textbf{(Cog-Sim)}$和$\textbf{C}$ognitive-$\textbf{S}$tate $\textbf{T}$transition--Driven $\textbf{P}$olicy $\textbf{O}$ptimization $\textbf{(CSTPO)}$。 Cog-Sim 维持用户的认知和情感状态,并通过轮流中的受限状态转换生成响应,因此反馈取决于实现的话语和用户的当前状态。 CSTPO 将每个动作组织为分层策略——话语表示:高级策略标签约束话语采样,并且话语在每个标签内进行优化。稀疏全分支采样重用共享对话前缀并估计单独的策略级和话语级优势,从而实现两个级别的细粒度优化。在三项任务中,Cog-Sim 表现出单调的剂量反应关系,并且在自然性方面优于基于提示的模拟器。 CSTPO 将 Qwen3-14B 的性能提高到与基于 GPT-5.5 的规划方法相当的水平。