论文
自适应 LLM 智能体中评估者驱动的偏好动态的诊断框架和多评估者审核
A Diagnostic Framework and Multi-Evaluator Audit of Evaluator-Driven Preference Dynamics in Self-Adapting LLM Agents
摘要
专有的 LLM 评估器的测量可能会在几周内变得无效 - 我们记录了一个案例并提供了诊断框架来检测它。我们引入了 EPC——包括多模态偏好崩溃指数 (MPCI)、评估者索引耦合矩阵和 Jensen-Shannon 散度 (JSD)——并将其应用于八个实验条件(N=112 主 + N=10 消融 = 122 个唯一重复,全部报告)。每个条件平均值的耦合系数范围为 0.00 到 1.18(CV 约为 0.9,n=8 条件)。四种情况表现出强耦合(N=36;GPT-4o May、GPT-4o-mini、Qwen3.7-plus、DashScope 30r);四个崩溃到接近零(N=76;GPT-4o June,qwen-plus N=30,对称 LR,DeepSeek 自我评估)。 5 月至 6 月的 GPT-4o 漂移——N=8 的重复复制推翻了研究的结论——是最具信息性的测量:检测到其自身不稳定性的诊断仪器表明了其设计用于测量的脆弱性。自我评估(97% 为零,JSD=0.003)始终崩溃,尽管下限效应是可能的。输出格式混杂分析发现每个策略聚合 rho=0.89 但每个实例 rho=0.219 (p=0.093); PCI 报告为偏好收敛指标。我们发布包含所有数据的 EPC。这一发现不是任何单一的耦合幅度,而是版本条件不稳定性的模式,这使得单快照评估器研究不可靠。