论文
两个不同的表情符号:多语言情感生成基准实际衡量的是什么
Two Emojis of Difference: What Multilingual Affective Generation Benchmarks Actually Measure
摘要
我们审核了八个经过指令调整的大语言模型的多语言情感生成基准,为 17,100 个孟加拉语、英语和印地语句子生成表情符号摘要,并进行了 6,960 个人类判断,发现其主要结论是测量工具的产物,而不是系统的属性。将注释器视为随机因素而不是固定因素,没有系统与任何其他系统有显着差异($F(7,14)=0.59$,$p=0.76$),尽管传统分析声明 28 个成对差异中有 19 个显着。注释者身份比系统身份解释更多的评级差异,并且只要删除任何单个注释者,获胜系统就会发生变化。确实出现的排序跟踪输出长度:平均表情符号数量解释了系统间差异的 78.7%,并且超过 2,599 对的项目内长度匹配比较扭转了排行榜。我们进一步表明,跨提供商的各向异性差异在均值中心化下消失,每种语言的词元成本随标准化单元改变符号,多视图行向分割使宏 F1 膨胀 3.1个百分点并改变排名靠前的系统。我们提出**表情符号影响可解码性**来代替偏好评分,这是一种基于参考的探针,其排名在种子之间稳定为 $\pm0.003$ 宏 F1。