论文

更多并不意味着更多:LLM 意见的多样性最重要的是什么?

More Is Not More: What Matters for Diversity in LLM Opinions?

模型评测模型行为与机制分析

摘要

大语言模型 越来越多地用于在开放式任务中模拟不同的人类观点,例如综合调查、焦点小组建模和舆论预测。然而,LLM 输出表现出系统性意见同质化。从业者已经探索了各种干预措施来增加多样性,但情况仍然支离破碎:不同的方法是用不可比较的指标单独评估的,并且在实践中它们通常是同时部署和升级的,因此很难将收益归因于特定的组成部分。为了促进对 LLM 输出多样性的更科学的理解,我们设计了一个析因实验,将两个主要干预维度分开:输入调节(通过角色深度操作)和交互架构。我们评估了 7 个模型中 100 个真实用户开放式问题的所有条件,通过多个互补指标衡量多样性。我们的发现挑战了几个常见的假设。首先,更多的角色细节并不会单调地增加多样性。角色调节的第一步已经获得了大部分收益,而对人口统计细节的进一步阐述并不能持续改善,并且可能会减少某些模型的多样性。其次,我们发现不同的架构不是寻求单一的最佳交互架构,而是探索很大程度上不重叠的意见区域。组合多种架构比优化任何一种架构都能产生更广泛的覆盖范围。第三,与结构化干预措施相比,通常尝试的低成本替代方案(例如提高采样温度和添加多样性指令)产生的影响可以忽略不计。总体而言,我们的工作表明,多样性不是沿任何单一维度扩展的产物,而是对干预措施的结构形式和组合高度敏感。