论文
从归因到行动:激活引导的以人为中心应用
From Attribution to Action: A Human-Centered Application of Activation Steering
摘要
可解释人工智能(XAI)方法能揭示哪些特征影响模型预测,却几乎没有提供让从业者依据这些解释采取行动的手段。对通过XAI识别出的组件进行激活引导,为实现可行动的解释提供了一条路径,但其实际效用仍缺乏研究。我们提出一个交互式工作流,将基于SAE的归因与激活引导相结合,对视觉模型中的概念使用进行实例级分析,并以网页工具形式实现。基于该工作流,我们围绕CLIP上的调试任务开展了半结构化专家访谈(N=8),研究从业者如何对激活引导进行推理、信任和应用。我们发现激活引导使从业者从单纯检视转向基于干预的假设检验(8/8名参与者),其中多数人将信任建立在观察到的模型响应上,而非解释本身的合理性(6/8)。参与者采用了以组件抑制为主的系统性调试策略(7/8),并指出了涟漪效应以及实例级修正泛化能力有限等风险。总体而言,激活引导让可解释性更具可行动性,同时也带来了关于安全有效使用的重要考量。
