人工智能助手收到的请求会遗漏获得良好结果所需的信息,例如有关用户的偏好或目标的信息。然后,他们必须推测或询问更多信息,然后再继续。我们将其重新概念化为信息价值问题:助手应该获取那些信息的缺失会导致用户效用的最大可避免损失。事前很少有人知道这一点;相反,助理必须预测它,以便最佳地分配有限的用户交互。我们在图像生成中实例化这个问题,并使用多轮模拟用户导出强化学习框架,以在不确定性下最大化效用恢复。在一项涉及 76 名参与者的 456 次互动会话的预注册研究中,这可以帮助用户更好地匹配参考图像,同时问题显着减少,总交互时间更少,成本也更低。这为训练语言模型助手提供了一个简单且可扩展的框架,可以通过提出更多信息性问题来更好地消除用户意图的歧义。
图 1.单个实例上训练管道的简化概述。 $k$细节的集合$\mathcal{H}$是从全套细节$\mathcal{D}$中编辑出来的,并且保留的细节$\mathcal{D}\setminus\mathcal{H}$被重写为自然用户请求$x$。助手向模拟用户提出澄清问题,并根据 $x$ 和答案组成用于生成图像的描述 $y$。然后,法官通过检查 $y$ 与支票 $\chi_{i}$ 来决定助理恢复 $\mathcal{H}$ 中的哪些详细信息,从而给出恢复的实用程序 $u_{\mathrm{rec}}$。 训练使用 $u_{\mathrm{rec}}$ 作为每个实例对 $g$ 执行轨迹的奖励,并且最终根据基本模型对经过训练的助手进行评估。训练管道概述。完整的参考规范被分解为一组细节。 k 个细节的子集被隐藏,剩余的细节被重写为初始请求 x。助理收到该请求并提出澄清问题。模拟用户保留完整的参考规范并提供答案。助手将请求和答案组合成最终描述 y,用于图像生成。法官检查 y 中存在哪些隐藏细节并计算它们的恢复分数。同一实例的 g 执行轨迹的恢复分数提供了训练奖励。然后将经过训练的助手与基本模型进行比较。模拟用户和裁判可获得的信息包括向助理隐瞒的参考细节。