论文
个性调整的大语言模型能成为更好的社交代理人吗?
Do Personality-Tuned LLMs Make Better Social Agents?
摘要
大语言模型越来越多地应用于社交互动代理和机器人的社交模拟中,比基于规则的系统提供了更大的灵活性。然而,尽管它们很好地模仿了人类的行为,但它们仍然存在着一种持续的陌生感。这项工作研究了与单独的指令提示相比,个性感知微调是否可以通过提高个性条件对话生成的一致性和可控性来缩小这种差距。我们使用结合了个性标签的社交媒体帖子和对话的语料库对两个小型开放权重大语言模型 Qwen2.5-7B-Instruct 和 Ministral-8B-Instruct 进行微调,以创建用于社交模拟的基于个性的对话引擎。最终的模型由三名独立的大语言模型法官在多个社交互动场景中进行评估,评估人格忠诚度并提供基于证据的行为解释。我们还量化了所生成对话的评分者间一致性和词汇特征。结果表明,微调模型在扮演不同性格的角色方面并不比各自的基线模型更好。然而,评估者之间的低一致性限制了解释这些结果的信心。关于生成文本的质量,微调后的模型大多与基线相当,微调提高了 Qwen 模型的语言多样性。虽然结果看起来普遍可用,并且基线模型提供了最佳的整体性能,但未来的研究应更加重视训练数据的质量和领域一致性,以实现准确的个性角色扮演。