论文
大语言模型创意任务中的模型内与提示间变异性
Within-Model vs Between-Prompt Variability in Large Language Models for Creative Tasks
摘要
LLM输出方差中有多少可由提示解释,多少由模型选择或采样随机性解释?我们通过让12个LLM在10个创造力提示上各生成100个样本(N=12,000)来回答这个问题。对于输出质量(独创性),提示解释36.43%的方差,与模型选择(40.94%)相当。但对于输出数量(流畅性),模型选择(51.25%)和LLM内方差(33.70%)占主导,提示仅解释4.22%。提示是引导输出质量的有力杠杆,但鉴于可观的LLM内方差(10-34%),单样本评估有将采样噪声与真实提示或模型效应混淆的风险。
