论文
超越单一输出:语言模型生成分布的可视化与比较
Beyond One Output: Visualizing and Comparing Distributions of Language Model Generations
摘要
用户通常通过单一输出与语言模型交互并评估它们,但每个输出只是可能的补全这一广泛分布中的一个样本。这种交互隐藏了分布结构,例如众数、罕见的边缘案例以及对提示微小变化的敏感性,导致用户在为开放式任务迭代提示时从个例过度概括。通过对使用语言模型的研究者(n=13)的形成性研究——考察随机性在实践中何时重要、他们如何推理语言上的分布、以及当前工作流在何处失效——我们提出了GROVE。GROVE是一种交互式可视化,将多个LM生成表示为穿过文本图的重叠路径,在保留对原始输出访问的同时揭示共享结构、分支点和聚类。我们通过三项针对互补分布任务的众包用户研究(N=47、44和40名参与者)进行评估。结果支持一种混合工作流:图摘要改进诸如评估多样性之类的结构性判断,而直接检查输出在面向细节的问题上仍然更有效。