论文

通过稀疏自动编码器将句子嵌入与人类概念对齐

Aligning Sentence Embeddings to Human Concepts via Sparse Autoencoders

模型评测模型行为与机制分析

摘要

密集句子嵌入是现代检索增强生成(RAG)系统的基础,但由于特征叠加而缺乏可解释性。这种不透明性阻碍了检索过程与人类意图的一致性,因为纠缠的表示难以分析或控制。在这项工作中,我们提出了一种使用 Top-k 稀疏自动编码器(SAE)将句子 Transformer(例如 E5)的密集表示分解为人类可解释的概念的方法。我们证明这些解开的特征与特定的语义、句法和语用类别相一致。此外,我们引入了一种激活引导机制,可以在检索过程中进行精确干预。通过限制特定的潜在特征,我们表明可以对搜索结果重新排名,以更好地与用户约束保持一致,而无需重新训练骨干模型。我们的研究结果表明,基于 SAE 的分解为透明且可操纵的神经信息检索提供了一条可行的途径。