论文
用于保护自主性支持性对话代理的护理条件神经调节
Care-Conditioned Neuromodulation for Autonomy-Preserving Supportive Dialogue Agents
摘要
部署在支持或咨询角色中的 大语言模型 必须在有用性与保留用户自主权之间取得平衡,但标准对齐方法主要针对有用性和无害性进行优化,而没有明确建模关系风险,例如依赖性强化、过度保护或强制指导。我们引入了护理条件神经调节(CCN),这是一种状态相关的控制框架,其中从结构化用户状态和对话上下文中获取的学习标量信号条件响应生成和候选选择。我们将这种设置形式化为自治保留对齐问题,并定义一个效用函数,奖励自治支持和帮助,同时惩罚依赖和强制。我们还构建了多轮对话中关系失败模式的基准,包括保证依赖、操纵性关怀、过度保护和边界不一致。在此基准上,护理条件候选生成与基于效用的重新排名相结合,在保持可比较的支持性的同时,将自治保留效用提高了+0.25(与监督的 微调 相比),比偏好优化基线提高了+0.07。试点人类评估和零样本转移到真实的情感支持对话显示了与自动化指标的方向一致。这些结果表明,依赖于状态的控制与基于效用的选择相结合是自治敏感对话中多目标协调的实用方法。