论文

VISTA:经由高效分析的token归因可视化

VISTA: Visualization of Token Attribution via Efficient Analysis

模型评测模型行为与机制分析

摘要

理解大语言模型(LLM)如何处理提示中的信息仍是一项重大挑战。为了揭示这一黑箱,研究者开发了注意力可视化技术,以捕捉神经元层面的感知并解释模型如何聚焦于输入数据的不同部分。然而,许多现有技术专为特定模型架构(尤其是Transformer家族)定制,且常常需要反向传播,导致GPU显存占用近乎翻倍、计算成本上升。轻量且与模型无关的注意力可视化方法仍然缺失。本文提出一种与模型无关的token重要性可视化技术,以更好地理解生成式AI系统如何感知和优先处理输入文本中的信息,且不产生额外计算成本。我们的方法利用基于扰动的策略,结合三矩阵分析框架,生成展示token对模型预测贡献的相关图。该框架包括:(1) 角度偏差矩阵(Angular Deviation Matrix),捕捉语义方向的偏移;(2) 幅度偏差矩阵(Magnitude Deviation Matrix),度量语义强度的变化;(3) 维度重要性矩阵(Dimensional Importance Matrix),评估各个向量维度上的贡献。通过系统地移除每个token并度量这三个互补维度上的影响,我们得到一个复合重要性分数,为token显著性提供了细致且有数学依据的度量。为支持可复现性并促进更广泛的采用,我们提供了所提出和使用的全部可解释性技术的开源实现,代码与资源公开于 https://github.com/Infosys/Infosys-Responsible-AI-Toolkit