论文

量化数据影响力和数据相似性之间的一致性以了解 LLM 行为

Quantifying the Agreement Between Data-Influence and Data-Similarity to Understand LLM Behavior

模型评测模型行为与机制分析

摘要

了解 LLM 行为的一种方法是将其输出追溯到训练数据。输出跟踪通常使用两种类型的度量:数据相似性和数据影响力。前者更便宜,而后者被认为更准确。尽管许多作品已经将它们与 真值 任务进行了比较,但对于输出跟踪不存在这样的比较。在这里,我们填补了这一空白,并精确量化了这两种措施之间的共性和差异。为此,我们首先根据每个度量对训练文档进行排名,然后计算两个排名之间的重叠。我们的主要发现是,这两个排名显着一致,但它们之间存在不对称性:数据相似性最高的文档根据数据影响力分配的排名比反之更一致。该结果在涉及 OLMo2-1B、Qwen3-1.7B、LlaMa3.2-1B、Gemma3-1B 和 GPT2 的一系列实验中有效。我们利用不对称性,通过使用昂贵的数据影响来细化数据相似性的结果,从而获得有利的成本准确性权衡。