论文
多模态评估器偏好崩溃:自进化智能体中的跨模态耦合
Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents
摘要
当人工智能代理使用语言模型在反馈循环中评估自己的输出时,就会出现系统偏差。我们表明,评估者偏好崩溃(EPC)在多模式环境中显着放大。使用 GPT-4o 跨文本和视觉任务评估 DeepSeek-chat,我们发现单一策略 (step_by_step) 吸收了所有权重的 48.4%,是纯文本自我评估中观察到的崩溃的 3.2 倍,而三种视觉域策略仅获得 9.1% 的组合权重。然后,我们展示了一种我们称之为跨模态耦合的新现象:评估者在一种模态上获得的偏好转移到另一种模态上,并破坏了另一种模态上的策略选择。通过四阶段隔离训练范例,我们测量耦合系数和文档策略反转——模态的最佳策略在跨模态暴露后反转。对文本代理和真实图像视觉任务的五种评估器配置(N=80 总独立重复,约 35,000 个 API 调用)进行的第 3 阶段统计验证发现:跨模型评估产生强耦合(JSD~0.19-0.34),真实图像输入产生方向最一致的信号(平均 gamma_{T->V}=1.145,gamma_{V->T}=0.937,70% T->V,Cohen d = 0.56),并且自我评估提供了近乎完全的免疫力——97%的运行(N = 30)产生零耦合(JSD = 0.003,d = 0.07)。三种方法消融和多执行器验证证实该效果不是结构性伪影。我们引入了由评估者身份索引的耦合矩阵,发布了 MM-EPC 框架,并将跨模型评估器架构确定为偏好漂移的主要风险因素。代码和数据:https://github.com/aidless/mm-epc。