论文
大语言模型的独立性如何?用于审计行为纠缠和重新加权验证者集合的统计框架
How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles
摘要
大语言模型(LLM)生态系统的快速增长提出了一个关键问题:看似不同的模型真的是独立的吗?共享的预训练数据、蒸馏和对齐管道可能会引发隐藏的行为依赖性、潜在的纠缠,从而破坏多模型系统,例如 LLM 作为法官管道和集成验证,这些系统隐式地假设独立信号。在实践中,这表现为相关推理模式和同步失败,其中明显的一致性反映了共享错误模式而不是独立验证。为了解决这个问题,我们开发了一个统计框架来审计黑盒大语言模型之间的行为纠缠。我们的方法引入了多分辨率层次结构,通过两个信息论指标来表征联合故障流形:(i)难度加权行为纠缠指数,它放大了简单任务的同步故障;(ii)累积信息增益(CIG)指标,它捕获错误响应中的方向对齐。通过对来自六个模范家庭的 18 名大语言模型进行广泛的实验,我们发现了广泛存在的行为纠缠,并分析了其对大语言模型法官评估的影响。我们发现,CIG 与法官精度下降存在统计显着相关性,GPT-4o-mini 的 Spearman 系数为 0.64 (p < 0.001),基于 Llama3 的法官的 Spearman 系数为 0.71 (p < 0.01),表明更强的依赖性对应于过度认可偏差的增加。最后,我们通过解纠缠验证器集成重新加权来演示纠缠的实际用例。通过根据推断的独立性调整模型贡献,所提出的方法减轻了相关偏差并提高了验证性能,与多数投票相比,准确率提高了 4.5%。
