论文

DiscoverLLM:从执行意图到发现意图

DiscoverLLM: From Executing Intents to Discovering Them

模型训练强化学习

摘要

为处理含糊而开放式的请求,大语言模型(LLM)越来越多地被训练与用户交互,以呈现用户尚未表达的意图(例如提出澄清问题)。然而,用户之所以含糊,往往是因为他们尚未形成自己的意图:他们必须观察并探索各种结果,才能发现自己想要什么。当用户自己都不知道答案时,简单地问“你想要什么样的语气?”就会失败。我们提出 DiscoverLLM,一个新颖且可泛化的框架,训练 LLM 帮助用户形成并发现其意图。该方法的核心是一个新颖的用户模拟器,它用逐级递进具体化的意图层级来建模认知状态——具体化程度可作为奖励信号,模型可经训练学会优化它。由此训练出的模型学会与用户协作:当意图不清晰时自适应地发散(即探索选项),当意图具体化时收敛(即细化并落实)。在创意写作、技术写作和 SVG 绘制这三项所提出的交互基准上,DiscoverLLM 将任务表现提升超过 10%,同时把对话长度最多缩短 40%。在一项有 75 名人类参与者参与的用户研究中,DiscoverLLM 相比基线提升了对话满意度与效率。

DiscoverLLM:从执行意图到发现意图
图9:用户研究中使用的界面:(1)初始页面,向参与者解释任务并提供免责声明。(2)展示分配给参与者的任务,并为其呈现写作任务可能的主题或意图的页面。(3)多轮聊天界面。(4)要求参与者每三轮提供一次交互评分的提示。(5)告知参与者已完成该任务最少轮数的提示。(6)最终屏幕,要求参与者提供整体交互评分、对最终写作的满意度,并描述所观察到的模型的优点与缺点。