论文

ContextAdapt:评估大语言模型的情境适应和价值一致性

ContextAdapt: Evaluating Contextual Adaptation and Value Alignment in LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

诚实、自主和保密等价值观通常被视为支撑人工智能联盟的一般原则。然而,按照这些价值观行事意味着什么可能取决于做出决策的背景。在本文中,我们询问大语言模型(LLM)是否适当地适应跨专业环境的价值应用,同时在上下文变化不改变相关专业规范时保持一致。为了研究这个问题,我们引入了 ContextAdapt,一个涵盖医学、法律、金融和国家安全领域的诚实、自主和保密性的评估框架。借鉴主要来源的专业和监管文件,我们构建了一个价值 x 领域框架,并使用它来开发测试默认专业规则和公认例外的场景。我们根据 12 位大语言模型建议的行动和他们提供的理由对他们进行评估。在我们的主要实验中,模型实现了 95.6% 的平均适当性,尽管正确的特定领域理由的使用在不同模型中差异很大,从 25.6% 到 76.9%。在单独的因子实验中,明确命名专业领域并改变模型的角色对行为的影响有限。然而,不同的风险揭示了严重但局部的失败:在某些情况下,即使基本的专业义务保持不变,模型也会改变他们的反应。特别是,感知的严重性似乎可以作为在诚实和保密情况下进行披露的提示。这些结果表明,评估价值一致性要求我们不仅要考虑模型是否遵循抽象原则,还要考虑它们是否在不同的环境中适当地应用它们。