论文

ABLE:通过基于归因的大模型嵌入表示和映射 LLM

ABLE: Representing and Mapping LLMs via Attribution-Based Large-model Embedding

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 的爆炸性增长创造了一个异构且文档匮乏的生态系统,使得系统模型比较对于来源审计、安全分析和模型选择变得越来越重要。现有的表示方法很难有效地解决这种情况。当架构兼容时,分析内部参数的方法非常强大,但在结构异构性下面临可扩展性障碍,而依赖外部输出的方法可能会将具有相似行为的模型混为一谈,并且难以在不同分词器之间的更丰富的输出空间中对齐。为了弥补这一差距,我们提出了 ABLE(基于归因的大型模型嵌入),这是一个利用可解释性空间来构建模型表示的框架。通过与分词器无关的字级对齐聚合基于梯度的特征归因,ABLE 捕获特定于模型的输入敏感度模式,而不仅仅是表面级输出。除了经验效用之外,我们还提供了稳定性分析,表明在可微分 Transformer 型模型的标准正则性假设下,ABLE 引入了具有有限样本收敛保证的 Lipschitz 连续参数嵌入映射。对 239 个开源 LLM 进行的大量实验表明,我们的 无需训练 方法在关系预测、模型路由和基准分数预测方面实现了有竞争力或优越的性能。