论文
不受欢迎的角色:MCQA 中的 LLM 角色驱动的一代在不同维度上不稳定
Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions
摘要
角色驱动生成 (PDG) 在研究和行业应用中得到了广泛应用,其中 大语言模型 (LLM) 在完成某些任务时呈现“角色”。虽然通过自由格式文本(如对话)表达的角色在稳定性或一致性方面进行了大量工作,但相对而言,以非文本为主的输出(如多项选择题回答或 MCQA)中表达的角色经常被忽视。我们致力于解决这一差距,试图了解 LLM PDG 在 MCQA 任务中的不稳定性。我们开发了三个指标来调查表现、结果和问题正确性稳定性,评估三个不同的维度。使用这些指标,我们发现模型系列和模型大小之间以及跨问题域的不稳定性始终存在差异,数学/常识问题会导致更大的不稳定性。我们还发现任务提示格式比其他超参数(例如温度)引入了更多的预测不稳定性。最后,我们发现不稳定性与任务准确性相关,并且使用我们的不稳定性指标,找到不同的实验设置,这些设置会导致任务的不同最佳和最差角色,尽管它们相似。这揭示了检查 PDG 中超参数不稳定性的重要性。