论文
十六个模型,少于两个声音:测量没有唯一正确答案的整体色散
Sixteen models, fewer than two voices: measuring ensemble dispersion where no answer is uniquely correct
摘要
来自 10 个家族的 16 种语言模型平均产生了心理治疗案例的 1.69 种不同表述的语义多样性,而单个模型自身运行的单一模型基线为 1.43 种。在多个模型提供多种视角的前提下,集成向决策者提供了不止一种解读。他们的输出的分散性既可以作为多样性也可以作为不确定性来衡量,并且两种传统都根据该任务不承认的正确性标准来验证它。测量多样性是一个已解决的问题:Vendi 分数(相似性矩阵的冯·诺依曼熵的指数)是不同元素的有效数量。单一总体没有说明多样性的来源。我们定义每个模型的异议贡献,即模型与其集合中其他成员的平均相似度的补充:来自同一矩阵的幅度,而不是频谱索引的分解,其最大值标识最不同的声音。交叉模型和案例,我们作为预先注册的假设来测试模型同一性是否占异议方差的非零份额,并表征测试检测到的结构。该小组制定了 15 个分层小插图,产生了 7,082 种供分析的配方。模特身份是剩余异议的一个可检测的结构因素,但通常的类别仅部分地恢复了它:规模差异在成对之间指向相反的方向,家庭分组模型仅在五个两人线上,最不同的声音随着面板组成而变化,因此表面的异常值描述了整体而不是模型。异议并未追踪案例库分层的解释开放性;相反,它是按照临床内容进行组织的,使分散的整体产生一种可以测量而不是假设的属性。