论文
面向可信LLM推理的概率化概念感知转向
Probabilistic Concept-Aware Steering for Trustworthy LLM Inference
摘要
转向向量(SV)是大语言模型(LLM)的推理时干预技术:在推理过程中向中间激活添加概念特定方向向量以引导生成。但现有SV方法常产生表示不连贯的行为,损害可解释性与细粒度控制——主要因为既往工作聚焦二元正负转向评估,并采用无法捕捉语义对齐连续谱的离散聚类指标。本工作提出面向LLM推理的概率化概念感知转向(PCS)框架。PCS在保持原有任务能力的同时,经概念驱动的转向向量检索与概率化强度校准,提供可控、面向安全的语义偏置。
