论文

面向可信LLM推理的概率化概念感知转向

Probabilistic Concept-Aware Steering for Trustworthy LLM Inference

模型推理解码与生成控制

摘要

转向向量(SV)是大语言模型(LLM)的推理时干预技术:在推理过程中向中间激活添加概念特定方向向量以引导生成。但现有SV方法常产生表示不连贯的行为,损害可解释性与细粒度控制——主要因为既往工作聚焦二元正负转向评估,并采用无法捕捉语义对齐连续谱的离散聚类指标。本工作提出面向LLM推理的概率化概念感知转向(PCS)框架。PCS在保持原有任务能力的同时,经概念驱动的转向向量检索与概率化强度校准,提供可控、面向安全的语义偏置。

面向可信LLM推理的概率化概念感知转向:论文配图
图 1:概率概念感知引导 (PCS) 框架的图示。顶部面板比较了干预方法:虽然强力分布采样(红色块)依赖于固定的离散范围 λ1ε[−2,2]\lambda_{1}\in[-2,2] 和余弦相似性控制(步骤 1)执行标准隐藏干预 h′=M​h~h^{\prime}=M\tilde{h},但 PCS 分布采样(绿色块)引入了一种概率方法,其中系数λ0\lambda_{0} 从自适应高斯分布 𝒩⁡(μ,σ2)\mathcal{N}(\mu,\sigma^{2}) 中采样。 PCS 用上下文相关的概率采样取代了确定性的手动调整,以在不同的语义域中实现更高的对齐精度和更低的方差。