论文
解锁任务型对话中的主动性
Unlocking Proactivity in Task-Oriented Dialogue
摘要
主动的面向任务的对话 (TOD),例如对外销售,需要有说服力的代理来积极探究用户的担忧,并在有限的轮次内引导对话走向接受。然而,经过训练的LLM本质上是保守的,而奖励塑造强化学习(例如 GRPO)则举步维艰,因为它只会重新权衡已经被动的政策样本。我们证明,对用户潜在关注点的调节可以释放出任何数量的采样都无法破坏的主动能力,从而将这些关注点确立为关键的训练时间信号。为了落实这一发现,我们构建了 \textbf{认知用户模拟器},它将每个用户建模为分层角色,包括可观察的外部特征和隐藏的内部问题。模拟器产生忠实且多样化的交互,同时发出每轮状态动态来跟踪说服进度。然后,我们引入\textbf{模拟器诱导的非对称视图策略优化},它将建模的关注点和模拟状态转换转换为互补的训练目标:(1)\emph{非对称策略自蒸馏},将关注点感知行为从同一策略的特权视图转移到其可部署的、仅对话的视图; (2) \emph{状态转换政策细化} ...
