论文

从归因到行动:激活引导的以人为中心应用

From Attribution to Action: A Human-Centered Application of Activation Steering

模型评测模型行为与机制分析

摘要

可解释人工智能(XAI)方法能揭示哪些特征影响模型预测,却几乎没有提供让从业者依据这些解释采取行动的手段。对通过XAI识别出的组件进行激活引导,为实现可行动的解释提供了一条路径,但其实际效用仍缺乏研究。我们提出一个交互式工作流,将基于SAE的归因与激活引导相结合,对视觉模型中的概念使用进行实例级分析,并以网页工具形式实现。基于该工作流,我们围绕CLIP上的调试任务开展了半结构化专家访谈(N=8),研究从业者如何对激活引导进行推理、信任和应用。我们发现激活引导使从业者从单纯检视转向基于干预的假设检验(8/8名参与者),其中多数人将信任建立在观察到的模型响应上,而非解释本身的合理性(6/8)。参与者采用了以组件抑制为主的系统性调试策略(7/8),并指出了涟漪效应以及实例级修正泛化能力有限等风险。总体而言,激活引导让可解释性更具可行动性,同时也带来了关于安全有效使用的重要考量。

从归因到行动:激活引导的以人为中心应用:论文配图
图 1:从归因到行动的四步工作流程:从业者审查组件归因,形成有关组件角色的因果假设,并通过激活引导对其进行测试。由此产生的预测更新为假设评估提供即时反馈。示例显示抑制“女性”成分以评估其对“护士”工作角色分类的影响。