论文

以隐性特质引导缓解失准传染

Mitigating Misalignment Contagion by Steering with Implicit Traits

上下文与知识上下文工程

摘要

语言模型(LM)越来越多地用于高风险多智能体 setting,其中遵循指令与保持价值对齐至关重要。多数对齐研究聚焦单个LM与单个用户的交互,未处理多轮交互中失准行为在多个LM之间传播的风险。我们在多个LM参与多轮会话式社会困境博弈时发现了这一现象的证据,称之为失准传染(misalignment contagion):具体地,LM在博弈后变得更反社会,且当其他玩家被引导恶意行动时该效应加剧。我们探索多种引导技术以缓解失准传染,发现强化系统提示是不充分的且常常有害。相反,我们提出隐性特质引导:间歇性地向系统提示注入强化LM初始特质的语句,比重复系统提示更有效地让模型保持其初始亲社会行为。重要的是,该方法不需要访问模型参数或内部状态,适合日益常见的用黑盒模型设计复杂多智能体工作流的场景。

以隐性特质引导缓解失准传染:论文配图
图 1:我们方法的步骤:(1) 使用默认、善意或恶意的系统提示将不同的角色分配给语言模型 (LM),(2) 进行游戏前角色评估并识别核心隐性特征,(3) 智能体在多轮社交困境游戏中竞争,(4) 游戏后评估量化错位传染的影响以及我们通过隐性特征 (SIT) 干预进行的指导。