论文
SyRuP:通过 LLM 解码中的奖励引导预测增强系统提示跟随
SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding
摘要
大语言模型 (LLM) 越来越多地通过指定角色、格式和安全要求的系统提示进行控制。然而,模型仅通过上下文学习隐式地遵循这些提示,这对于复杂或组合提示来说可能是不够的。现有方法通常需要模型调整或响应级别重新排名,限制了其轻量级推理时间控制的实用性。我们引入了 SyRuP,一种解码时间框架,用于提高系统提示的依从性,同时保持基本 LM 冻结。 SyRuP 从系统提示条件偏好对中训练交叉注意奖励头,将系统提示视为单独的记忆,以产生 词元级 依从性分数。在推理时,SyRuP 通过将基础 logits 与学习的奖励信号和捕获系统引起的 logits 变化的对比信号相结合,对基础 LM 的前 k 个候选者进行重新排序。对系统提示遵循基准的实验表明,SyRuP 在适度的推理开销下始终优于提示和解码时间基线。这些结果表明,明确的 词元级 指导是可靠的系统提示跟随的有效且实用的机制。