论文
揭露未说出口:通过随机路径聚合可视化隐藏的 LLM 偏差
Exposing the Unsaid: Visualizing Hidden LLM Bias through Stochastic Path Aggregation
摘要
大语言模型 (LLM) 表现出表征和句法偏差,由于文本生成的随机性,这些偏差很难评估。标准审核方法依赖于单一输出检查或静态自动化指标。这些方法掩盖了潜在的概率分布,并且无法捕获隐藏在较低概率生成分支中的偏差。本文介绍了 TreeTracer,这是一种可视化分析工具,旨在通过聚合比较来评估 LLM 偏差。该工具使用系统的扰动分析管道,替换每个输入提示中本体定义的术语,将数百个随机生成聚合成语法对齐的层次结构,然后与辅助语言模型执行分类感知节点合并。生成的结构通过自定义桑基图可视化。通过并置两个本体驱动的树,工作区可以在语义上下文之间进行直接比较,并支持系统偏差检测。由于任何可视化仅反映模型学习行为的子集,因此系统进一步应用对比推理来计算并直接显示跨上下文的反事实标记概率,从而降低了误解偏见存在的风险。我们通过案例研究验证了工作空间,将未对齐的基线模型 GPT-2 XL 与结构对齐的 Apertus 模型进行比较。视觉聚合成功地揭露了隐藏的代表性危害,例如反事实代词抑制和个体的对话边缘化。一项初步的用户研究证实,聚合的比较界面减少了认知负荷,并有效支持分析师检测系统性偏差。