论文
量化用户模拟器在构建协作 LLM 助手方面的效用
Quantifying the Utility of User Simulators for Building Collaborative LLM Assistants
摘要
用户模拟器越来越常用于构建交互式 AI 助手,但其质量如何衡量仍未解决。论文提出用下游效用量化质量,即用该模拟器训练的助手在真实人类交互中的表现。在只改变模拟器的受控实验中,研究以强化学习训练助手,比较提示大语言模型扮演用户与用 WildChat 人类发言微调等模拟器。在283名参与者的用户研究及来自真实人机对话的 WildBench 上测量配对胜率。角色扮演模拟器训练的助手对初始助手胜率为51%,无统计显著差异;微调模拟器训练的助手则显著改善,对初始助手和角色扮演训练助手分别为58%和57%。进一步分析发现,人物设定等改进角色扮演真实性的方法虽有帮助,仍未缩小与微调模拟器的差距;扩大模拟器模型规模只对微调方案有益;角色扮演训练的助手在测试时换用其他模拟器难以泛化,而微调方案可以。结果支持以真实人类行为构建模拟器,并按其对真实用户的下游效果评价质量。