论文

记录分组控制语言模型中的证据权重

Record Grouping Controls Evidence Weight in Language Models

上下文与知识上下文工程

摘要

检索到的记录是表示单元;提供的分区确定哪些记录作为证据贡献进入语言模型。我们描述了不变的组内容状态,该状态删除组内副本,同时保留补充的规范内容,表明相同的组计数可以编码不同的证据状态,并得出清晰的内容感知分区错误界限。给定提供的分区,我们的预生成表示会删除重复数据并聚合组内的内容,并限制每个组的贡献。在 104,402 项试验和 6 个公共检查点中,中央自然文本干预发现内容固定的错误分割增加了 10.27-32.66 个百分点,错误合并减少了 9.13-31.79 个百分点;匹配的六槽对照保留所有 16 个单元的正方向。在一个新的 48 项受控活动面板中,更改提供的分区会在所有四个模型中产生可测量的、依赖于检查点的决策转变,并且平衡的镜像设计会暴露大量的订单交互。理论和实验共同将所提供的分区建立为可控的预生成表示变量,并表征其依赖于检查点的行为效应。