论文
AIMES:用在线观察反馈控制多个价值方向
Adaptive Multi-Value Control in LLMs via Causal Activation Steering
摘要
大型语言模型 (LLM) 越来越多地部署在响应必须反映多种可能相互作用的社会规范和人类价值观的环境中。激活引导通过在推理时修改内部激活,为基于训练的对齐提供了一种轻量级的替代方案。然而,现有的人类价值导向方法很大程度上孤立地考虑了价值,而多个方向的直接组合依赖于固定的干预强度,无法响应模型不断变化的内部状态。受这一关键观察的启发,我们引入了 AIMES,一个自适应多值激活转向的框架。 AIMES 为道德基础价值观构建特定层的双极方向,并使用中间层词汇读出作为在线观察者。然后,观察者引导的控制器根据其当前观察到的状态在每个解码步骤中调整每个请求值干预的强度,而无需训练单独的值状态估计器。在多个指令调整的模型系列、价值组合和干预深度中,我们发现多值可控性在价值组合和干预位置上都有所不同。与固定联合引导和基于提示的转向相比,AIMES 显示了与深度相关的优势,这些优势得到了两个独立评估者的广泛支持,但出现特定控制效果的精确深度存在一些变化。这些优点伴随着比固定联合引导更小的实现的激活空间干预和类似的响应质量。总的来说,我们的结果表明,在线观察者反馈可以为单次前向的多价值引导提供轻量级、状态感知的适应。
