论文
共享语义,不同机制:通过对齐语义和机制进行无监督特征发现
Shared Semantics, Divergent Mechanisms: Unsupervised Feature Discovery by Aligning Semantics and Mechanisms
摘要
随着 大语言模型 越来越多地部署在高风险环境中,人们越来越需要不仅可以审核模型输出,还可以审核生成模型输出的内部计算的工具。电路分析是机械解释的核心方法,但它通常是目标条件的,解释与所选完成配对的单个提示。这种目标条件设置可以掩盖模型连续分布的异质性。我们引入了分布级无监督特征发现,它使用语义内容和序列级机械属性对采样连续进行聚类,而无需手动指定目标输出。我们的方法用语义嵌入和前缀到延续属性签名来表示每个延续,然后优化率失真目标,以权衡语义一致性、机械一致性和集群粒度。通过聚类和转向分析,发现的聚类揭示了单视图基线错过的连续模式,并提供了聚类特征与可操作的机械因素相对应的干预证据。总的来说,我们的方法通过提供对模型连续分布基础机制的可扩展审计来补充电路分析和行为评估。