论文

H-Node:针对大模型幻觉隐藏维度的攻击与防御

H-Node Attack and Defense in Large Language Models

模型评测安全与风险评测

摘要

H-Node对抗噪声消除(ANC)从隐藏状态的单个维度分析Transformer大语言模型中的幻觉表征。在末词元隐藏状态上训练逻辑回归探针,将幻觉信号定位到少量高方差维度,称为幻觉节点;在四种架构上探针AUC达到0.90。白盒攻击通过推理时的实时前向钩子放大这些维度,选择性达到3.02倍,防御者可见程度低于10%。自适应ANC采用置信度加权消除抑制过量幻觉激活,相比静态消除将有事实依据的激活漂移减少33%—42%。动态迭代扩展在连续前向计算中重新排序消除目标,原文报告鲁棒性从单次计算基线的8%恢复至最高0.69。实验覆盖OPT-125M、Phi-3-mini-4k-instruct、LLaMA-3-8B-Instruct和Mistral-7B-Instruct-v0.3,规模为1.25亿至80亿参数。困惑度变化低于5%,MMLU下降最多3%。