论文

迈向稳定的价值对齐:引入独立模块实现一致的价值引导

Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

模型架构新型架构

摘要

将大语言模型(LLM)与人类价值对齐通常依赖于直接操纵骨干参数或表示空间的后训练或推理时引导。然而,存在一个关键缺口:模型的残差流高度动态,价值在其中以脆弱的低维属性存在,与一致价值表达所需的稳定性在本质上不相容。本文提出Stable Value Guidance Transformer(SVGT),通过一个独立价值模块弥补这一缺口,该模块包含两个关键设计:(1) 独立价值建模,在与骨干隔离的专用价值空间中维护规范性表示;(2) 显式行为引导,将这些稳定信号转换为可学习的潜在Bridge Tokens。这些token充当动态价值锚点,显式引导生成轨迹,在不破坏骨干内部表示的情况下确保在多样情境中的稳健遵循。跨多个骨干和安全基准的实验表明,SVGT普遍将有害得分降低70%以上,同时保持生成流畅性,证明了基于架构的价值建模的效能。代码发布于 https://github.com/Clervils/SVGT.git。

迈向稳定的价值对齐:引入独立模块实现一致的价值引导:论文配图
图 1:我们工作的概念图。残余流中的主导任务信号(橙色)通常会扭曲值表示,导致未对准(虚线)。我们的独立模块提供稳定的引导(固体),尽管任务有噪音,但仍可引导发电回到对齐状态。