论文
超越 词元级 指导:通过跨系列表示指导实现专业 LLM 的推理时间对齐
Beyond Token-Level Guidance: Inference-Time Alignment of Specialized LLMs via Cross-Family Representation Steering
摘要
针对专业领域进行微调的 大语言模型 (LLM) 代表了关键的高影响力应用程序。推理时间对齐可以改善因专业化微调而降低的安全性,而无需大量计算资源,从而通过易于使用的即插即用解决方案补充了基于微调的方法。然而,现有的推理时间方法无法在不破坏领域能力的情况下可靠地提高安全性。我们将根本原因确定为互补的专业正交性:专门的基础模型和通用领域引导模型具有正交能力,使得引导信号对于专门的生成来说不可靠。这主要表现为停止词元干扰,其中指导模型的继续趋势优先于基本模型的停止决定,将正确答案埋藏在指导诱导的继续之下。为了解决这个问题,我们提出了 CREST,一种推理时间对齐方法,它使用从任何系列的引导模型中提取的安全方向来引导基本模型隐藏表示,完全避免 词元级 结构限制。 CREST 提高了专业化削弱了安全性的地方,同时保留了特定领域的功能和已经良好对齐的模型的安全性,在安全基准上比基线高出高达 22.2%。我们的代码位于:https://github.com/DecayingSeart/CREST。