论文

持久的评估框架:大语言模型 中减少阿谀奉承的对抗性仲裁

Durable Evaluation Framework: Adversarial Arbitration for Sycophancy Reduction in Large Language Models

智能体系统Agent 协作

摘要

RLHF 训练的模型系统地偏向于准确性的一致性,这是训练过程的结构属性。我们提出了持久评估框架(DEF)仲裁,这是一种多智能体架构,它通过在两个针对相反 DEF 的模型之间进行仲裁来减轻身份框架的阿谀奉承,并使用一个实用主义综合器来评估这两个参数,而不考虑其起源。本文评估了基于提示的 DEF 仲裁实例。关键机制是静态DEF调整、综合前的身份剥离、单轮独立论证和盲仲裁。我们评估了来自 SycophancyEval 的 200 个分层问题的五个实例。所有测试的 DEF 变体(AnCifer、DeWin、FeynStein、BurGal、Trident)均显着优于单模型基线 (18.5%) 和指令反对基线 (29.0%),其中 DeWin 的准确率达到 48.5%(z=6.36,p<0.001 与两者相比)。在 n=200 时,这些变体彼此之间没有显着差异。 BurGal 变体达到了 53.0%,但起到了架构有效性检查的作用;它的共识/非正统轴在结构上有利于每个基准问题上的非正统模型。 预训练 下限影响估计 40% 的问题;下一步是微调 DEF 模型。