论文

大语言模型 中的证据集成

Evidence Integration in Large Language Models

模型评测模型行为与机制分析

摘要

尽管人们越来越依赖 LLM 来推理由工具、检索增强生成、其他代理和用户提供的外部证据,但 LLM 如何将这些证据整合到他们已经开始形成的决策中仍然很大程度上不清楚。我们提出了一种分布理论,其中证据在接收者先验权重和候选证据倾斜的驱动下改变接收者初始答案的分布,从而产生三个预测。首先,对接收者来说更有可能的候选人更有说服力。其次,与来自不同来源的外来错误相比,接收器更容易整合自己的特征错误。第三,相同的证据可以改善较弱的模型并损害较强的模型。我们确认了这超过一千万次试验,来自四个家族和八个领域的十二个 LLM,其中四个是物理和生命科学领域的科学发现任务:量子力学、物理学、遗传学和分子生物学。该定律还产生了一个与接收器相关的可靠性边界:接收器一致错误比相同速率的随机错误更严重地降低性能。 LLM 甚至在内部验证候选者的无效性后也将其整合(在命题约束下为 93-100%;在物理和生命科学推理上高达 99.4%),证明证据整合是对现有分布的特定于接收者的控制策略,由接收者属性而不是对证据源的标量信任决定。因果干预表明候选整合是在网络后期实施的,作为一个结构化的步骤序列,接受外部候选答案,提升它们,并将它们传输到答案状态。验证的表示是可解码的,但对答案几乎没有因果影响。 J 透镜分解表明,口头验证背后的状态与底层候选集成完全分离。