论文
BeliefScope:诊断大型语言模型中证据驱动的修订和压力引起的转变
BeliefScope: Diagnosing Evidence-Driven Revision and Pressure-Induced Shifts in Large Language Models
摘要
语言模型可能会在收到真正相关的证据后或收到未添加相关事实的定向用户压力后修改相同的命题。因此,仅可观察到的响应变化并不能揭示推动变化的来源。我们引入了 BeliefScope,这是一个受控黑盒框架,用于围绕固定目标命题分离这两个影响源。 BeliefScope 将证据和压力与特定因素的本地控制相结合,并通过概率报告、分类判断和适合渠道规模的行动建议来衡量响应变化。为了确定这些可观察到的对比何时支持可靠的归因,我们在受控合成条件下评估观察设计。已知真相恢复和有针对性的消融建立了可以分离证据和压力相关效应的位置,而半合成压力测试则描绘了随着观察过程变得更加嘈杂和更加异质,可恢复性如何变化。在一项针对 36 个 Qwen/Llama 家庭的研究中,针对 12 个家庭进行了检查, 包括 Gemma3-12B,生成的配置文件显示出显着的评估上下文依赖性:广泛的模型级别差异可以在匹配的控制、解码或响应接口下发生变化,而一些较窄的模型内模式保持稳定。指令干预进一步表明,减少目标对准压力跟随可以反映稳定的阻力或相反方向的运动。 BeliefScope 将这些测量结果总结为条件信念响应曲线,使诊断效果与观察到的评估条件相关联,以及该诊断的明确有效性边界。