论文
什么赢得选票?法语比较中的格式、长度和词汇多样性:IA LLM Arena
What Wins a Vote? Formatting, Length, and Lexical Diversity in the French Compar:IA LLM Arena
摘要
大语言模型领域将成对的人类偏好转化为模型排名。这些偏好可能反映了答案的呈现方式以及答案的内容。我们对 2026 年 7 月 Compar:IA 发布的 137,293 份决定性法语投票进行了风格计量;主要格式分析包括 116 个模型中的 137,113 场比赛,联合估计使用 127,092 场比赛以及所有所需的测量数据。对于每场战斗,我们都会重建用户投票时可见的响应。然后,我们将原始排名与根据格式、长度、可读性、词汇多样性和句子结构调整后的排名进行比较。演示与获胜相关,但长度、粗体文本和列表往往一起出现,使得他们各自的贡献很难分开。在测量的特征中,有两个关联在规范中变化最小:大胆使用(联合模型中每个标准差的获胜几率+11.0%)和移动平均类型标记比(MATTR),这是一种对答案长度不太敏感的词汇多样性衡量标准(+16.8%)。在观察到的多轮对话中,粗体关联要小得多,而 MATTR 关联变化很小;因为用户选择是否继续,所以这种差异是描述性的而不是因果性的。此次全面调整使 116 个型号中的 36 个型号提升了至少 10 个排名。然而,与外部基准的比较并没有表明调整后的排名可以更好地衡量能力。因此,我们建议并排发布原始排名和调整后排名,作为透明的敏感性分析。