论文
分工:将证据解读与决策聚合分离
Split the Labor: Separating Evidence Interpretation from Decision Aggregation
摘要
让语言模型从众多来源得出结论的系统通常将它们拼接进同一个提示。这混淆了两个要求不同的操作。解读一个来源奖励容量与上下文。组合解读则奖励固定的算术、跨实例的可比性以及返回空结果的选项。一旦分离,设计问题就变成两者之间的接口。我们提出一个四字段证据元组(假设、可靠性分桶、理据、出处),并表明固定它就同时决定了两个部分。这种分离还揭示了此类系统在组合时的一种失败模式,我们称之为计数尺度漂移(count-scale drift)。对未归一化权重之和做阈值化恰好等价于后验阈值化,但工作点会随所咨询来源的数量滑动。漂移随读取器可靠性的提高而增大。当来源可靠性各不相同时,投票规则与后验对实例的排序不同,且没有任何阈值能调和二者。合并校准的对数似然比可同时解决这两个问题。这一修复是算术层面的而非架构层面的,并且适用于语言模型之外的一类规则:按分数求和的分诊引擎、按阳性计数评分的诊断面板以及可加多信号检测器。随后我们在同一纵向语料上两次实例化该原则,一次在结局揭晓之后,一次在之前。同样的划分在两者中都有帮助,只是粒度不同:前者在读取上,后者在学习容量上。在后一情形中,一个在简单辅助目标上训练的小型序列编码器加上承载删失生存损失的树集成,达到0.921 AUPRC,而手工基线为0.805。我们区分了哪些内容可迁移、哪些必须按领域重新估计,并给出五个可证伪该框架的预测、三个阴性结果,以及哪些比较仍存在混杂。