论文
STEMMA:用于评估 LLM 中自我身份一致性的对抗性多代理框架
STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs
摘要
知识蒸馏 是 大语言模型 (LLM) 的训练和 微调 中广泛采用的技术,能够将结构化信息和功能行为从大型教师模型转移到较小的学生模型,同时显着降低计算成本。然而,随着 蒸馏 的使用规模和复杂性的增加,它提出了一个重要问题:什么样的知识真正从教师模型中转移出来。在这项工作中,我们认为除了功能知识之外,学生模型还学习行为模式,特别是模型如何表示自己的身份,引起对输出同质性、模型偏差和问责制的担忧。为了应对这一挑战,我们引入了 STEMMA,这是一种多模式和多智能体框架,其中特定角色的智能体在不同模型中协作探索自我识别行为。我们还贡献了一组手动设计的对抗性提示,用于评估 LLM 中的身份一致性。我们的结果表明,在某种程度上,大多数模型都容易受到自我表示不一致的影响。