论文
PRISM-X:使用人类和模拟用户进行个性化 微调 实验
PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users
摘要
个性化是数百万人使用的对话式人工智能系统的标准功能;然而,学术研究中经常使用模拟用户而不是真人来评估个性化方法的有效性。这就提出了这样的问题:用户和他们的模拟对手在交互模式和判断方面有何不同,以及个性化是否最好通过基于上下文的提示或基于权重的 微调 来实现。在此,在一项大规模受试者内实验中,我们在 PRISM 数据集(Kirk 等人,2024)中给出偏好两年后重新招募了来自 52 个国家的 530 名参与者,以在盲态多轮对话中评估个性化和非个性化语言模型。我们发现偏好 微调(P-DPO,Li 等人,2024)显着优于通用模型和个性化提示,但适应个人偏好数据比对来自不同人群的汇总偏好进行训练产生边际收益。除了长度偏差之外,微调 还放大了人们在短期评估中奖励的阿谀奉承和寻求关系的行为,但可能会带来有害的长期后果。用模拟用户复制这个受试者内实验可以恢复聚合模型层次结构,但模拟器的个人判断表现远低于人类自我一致性基线,讨论不同的主题,表现出放大的位置偏差,并产生与人类不同的反馈动态。