论文

RPS:带有强化提示选择的信息获取

RPS: Information Elicitation with Reinforcement Prompt Selection

模型训练强化学习

摘要

大语言模型(LLM)在对话生成和推理方面表现出了卓越的能力,但它们在开放式对话中引出用户已知但隐藏的信息的有效性仍然有限。在许多交互式人工智能应用中,例如个人助理、辅导系统以及法律或临床支持,用户经常由于隐私问题、模糊性或社交犹豫而隐瞒敏感或不确定的信息。这使得 LLM 收集完整且上下文相关的输入变得具有挑战性。在这项工作中,我们定义了开放式对话环境中的信息获取问题,并提出了强化提示选择(RPS),这是一种轻量级强化学习框架,它将提示选择制定为顺序决策问题。为了在受控环境中分析这个问题,我们设计了一个综合实验,其中强化学习代理的性能优于随机查询基线,说明了基于策略的自适应信息获取方法的潜力。基于这种洞察力,RPS 通过一系列提示学习策略,通过对话自适应地从用户那里引出隐藏或不完全表达的信息。我们还引入了 IElegal,这是一个根据真实法律案件文档构建的新基准数据集,它模拟基于对话的信息获取任务,旨在揭示案件相关事实。在此设置中,RPS 优于静态提示基线,证明了自适应提示选择在 LLM 驱动的对话系统中引出关键信息的有效性。