论文
Gemma 4 的冲突文档偏好:措辞影响超过位置
Words Speak Louder Than Order: A Behavioral Evaluation of Gemma 4
摘要
当语言模型收到两个冲突的文档作为输入时,它如何决定优先考虑哪一个?它是否依赖于来源的框架或文档的呈现顺序?我们使用完全平衡的实验设计,在 Google 预训练的 Gemma 4-e4b 模型上跨目标行为套件(n = 13 个项目,短单轮上下文中的 784 次前向传递)评估了这种行为。这种设置使我们能够在数学上隔离源框架和阅读位置的具体影响,同时确保消除模型的自然词汇偏差。在十个测试条件中,我们发现了以下内容: 1. 源框架严重压倒了阅读位置。当直接竞争时,源的语义框架(例如将其作为官方指南或最新更新呈现)对模型最终答案的影响比文档的呈现顺序要大得多。 2. 该模型倾向于它读取的第一个文档,但这种偏差变化很大。虽然该模型始终表现出首因效应(更倾向于第一个呈现的文档),但这种偏差的实际强度仅根据表面措辞就波动至少 5 倍。 3.整体结构重复,而不是简短的文案提示,导致了位置偏差。模型对第一个文档的偏好并不是对简短、重复的触发短语(例如“is [Answer]”)的机械反应。然而,当两个竞争文档使用逐字逐字模板结构相同时,首因效应确实会显着增加。在两个来源之间引入整体措辞的变化可以减少这种位置偏差。
