论文
Deep Noir:自动寻找Transformer激活引导位置与强度
Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models
摘要
激活引导在推理时修改LLM行为,但选择在哪里、以多大强度干预仍依赖人工。我们提出Deep Noir,利用Logit Lens收敛与注意力头级因果归因自动发现最优引导参数。跨三个规模组(3个1B模型、2个2—3B模型、4个7—9B模型),引擎在1B垃圾信息任务上提高16.7个百分点(标准差4.7,39次运行),在四种7—9B架构上增幅达到21—42个百分点。对SST-2情感任务,无需修改代码即可提高13.1个百分点。机制层面的依据支持自动发现可跨任务、跨架构泛化的干预点。在情感任务上,不带注意力头掩码的RepE未优于基线,而Deep Noir改善了全部模型(p<0.01)。我们进一步表明,引导会产生可预测的提示注入攻击面,其脆弱性随引导幅度单调增加。这一发现与部署经引导分类器的智能体系统相关。
