论文

大语言模型创意任务中的模型内与提示间变异性

Within-Model vs Between-Prompt Variability in Large Language Models for Creative Tasks

模型评测鲁棒性、公平性与可信度评测

摘要

LLM输出方差中有多少可由提示解释,多少由模型选择或采样随机性解释?我们通过让12个LLM在10个创造力提示上各生成100个样本(N=12,000)来回答这个问题。对于输出质量(独创性),提示解释36.43%的方差,与模型选择(40.94%)相当。但对于输出数量(流畅性),模型选择(51.25%)和LLM内方差(33.70%)占主导,提示仅解释4.22%。提示是引导输出质量的有力杠杆,但鉴于可观的LLM内方差(10-34%),单样本评估有将采样噪声与真实提示或模型效应混淆的风险。

大语言模型创意任务中的模型内与提示间变异性
图3:平均原创性得分(Mean Originality Scores)的热力图(模型 × 提示)。提示图例同图2。