论文

模型编写文本的共同品味:“AI-AI 偏差”的生成器选择器矩阵显示没有可检测到的自有模型溢价

A Shared Taste for Model-Written Text: The Generator-by-Selector Matrices of "AI-AI Bias" Show No Detectable Own-Model Premium

模型评测模型行为与机制分析

摘要

劳里托等人。 (PNAS 2025)表明,在同一产品、论文或电影的两种描述之间进行选择的大语言模型更喜欢由语言模型编写的描述,而不是由人编写的描述,远远超过人类评审的选择。他们的设计跨越了五个具有与选择器相同的五个模型的生成器,这允许提出本文未标题的第二个问题:选择器是否更喜欢来自其自己模型的文本,而不是生成器和选择器主效应预测的内容?我们根据作者公共存储库中的每个项目计数重建了三个 5x5 矩阵(21,828 个有效试验;每个单元格都与发布的值匹配),并用自己的模型项 gamma 拟合双向固定效应模型,通过对选择器的 120 次重新标记进行精确排列测试进行测试。产品溢价为 +0.013(精确单边 p = 0.24),论文摘要溢价为 -0.010(p = 0.74),电影溢价为 +0.054(p = 0.07),汇总溢价为 +0.019(p = 0.14;95% 区间为 -0.008 至 0.046)。 GPT-3.5 和 GPT-4 对的同一供应商术语在所有三个数据集中都是负数。位置偏差使单个单元在任一方向上移动最多 0.42 个份额点,并且一旦移除订单驱动的项目,自身模型对比度就不会改变。该设计在 82%(产品)、88%(论文)、42%(电影)和 97%(合并)功效时检测到的溢价为 0.05; 80% 功率时的最小可检测效果为 0.034 合并。低至约 0.04 股点时,缺席的情况会提供信息,低于此值则保持沉默。 Tan 等人的 4x4 矩阵。 (ACL 2024) 在其 24 个重新标记允许的最小 p 处给出 gamma = +0.148,具有相同大小的同族术语。 Laurito 等人的主要结果。代表:模型对模型编写的文本有着共同的偏好,GPT-4 的描述在 77% 到 95% 的情况下被产品的每个选择者选择。这些数据并没有显示出一个模型认可并偏爱自己的散文。