论文
以隐性特质引导缓解失准传染
Mitigating Misalignment Contagion by Steering with Implicit Traits
摘要
语言模型(LM)越来越多地用于高风险多智能体 setting,其中遵循指令与保持价值对齐至关重要。多数对齐研究聚焦单个LM与单个用户的交互,未处理多轮交互中失准行为在多个LM之间传播的风险。我们在多个LM参与多轮会话式社会困境博弈时发现了这一现象的证据,称之为失准传染(misalignment contagion):具体地,LM在博弈后变得更反社会,且当其他玩家被引导恶意行动时该效应加剧。我们探索多种引导技术以缓解失准传染,发现强化系统提示是不充分的且常常有害。相反,我们提出隐性特质引导:间歇性地向系统提示注入强化LM初始特质的语句,比重复系统提示更有效地让模型保持其初始亲社会行为。重要的是,该方法不需要访问模型参数或内部状态,适合日益常见的用黑盒模型设计复杂多智能体工作流的场景。
