论文

PromptCD:通过极性提示对比解码进行测试时行为增强

PromptCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding

模型推理解码与生成控制

摘要

可靠的 AI 系统要求大语言模型(LLM)表现出与人类偏好和价值观一致的行为。然而,多数现有对齐方法在训练时运作并依赖额外的高质量数据,带来可观的计算与标注成本。尽管近期工作表明对比解码可以利用模型内部分布改进特定能力,其适用范围仍局限于狭窄的行为范围与场景。在这项工作中,我们提出 Polarity-Prompt Contrastive Decoding(PromptCD),一种测试时行为控制方法,将对比解码泛化到更广泛的增强设定。PromptCD 为目标行为构建配对的正、负引导提示,并对比模型响应——具体是 LLM 中的 token 级概率分布和 VLM 中的视觉注意力模式——以强化期望的结果。这一形式化将对比解码扩展到广泛的增强目标,且无需额外训练即可适用于 LLM 与视觉语言模型(VLM)。对 LLM,在“3H”对齐目标(helpfulness、honesty、harmlessness)上的实验显示一致且可观的改进,表明经后训练的模型可以纯粹在测试时实现有意义的自我增强。对 VLM,我们进一步分析对比对视觉注意力的影响,显示 PromptCD 通过强化行为一致的视觉落地显著提升 VQA 性能。总之,这些结果凸显 PromptCD 是跨模态可靠行为控制的简单、通用且低成本的策略。

PromptCD:通过极性提示对比解码进行测试时行为增强
图1:PromptCD 概览。一个用于测试时行为增强的统一框架。通过对比由正提示与负提示诱导的 logits(用于文本)或视觉注意力图(用于图像),PromptCD 无需重新训练即可有效引导模型朝向期望目标。我们通过 LLM 中的忠实度增强与 VLM 中的视觉专注度提升来展示这一能力。