论文

DiPS:高风险说服代理的对话政策选择

DiPS: Dialogue Policy Selection for High-Stakes Persuasion Agents

智能体系统Agent 规划

摘要

大语言模型 (LLM) 在高风险场景中经常难以说服。人们的个性和关注点需要量身定制的策略,而不是一刀切的方法。为了应对这一挑战,我们重点关注火灾救援场景,其中操作员必须说服居民疏散作为高风险说服域,并提出对话策略选择(DiPS),这是一个 Q 学习框架,用于动态选择适应不断变化的对话环境的说服策略。具体来说,我们训练了一个批评者,经过训练以最大限度地提高疏散成功的机会,根据居民最近的言论在每个回合选择说服政策。然后,我们在模拟和真实的人类交互中根据多个基线评估 DiPS。我们发现 DiPS 比零样本 LLM 和通用 RAG 增强方法取得了更高的疏散成功率。