论文
DySem:揭示 大语言模型 的动态语义组件以计算语义文本相似度
DySem: Uncovering Dynamic Semantic Components of Large Language Models for Calculating Semantic Textual Similarity
摘要
计算语义文本相似度是自然语言处理中的一项基础任务。当前基于 大语言模型 (LLM) 的方法通常依赖于提取具有固定维度的最后一层隐藏状态来计算每个文本对的相似度。我们认为这种范式受到两个限制:(i)最后一个隐藏层编码更多的一般知识而不仅仅是语义知识,这使得它对于语义相似性计算来说不是最佳的; (ii) LLM 的隐藏层维度通常非常大,这为表示语义引入了一些冗余和噪声。在这项工作中,我们提出了 DySem,一种新颖的 无需训练 框架,它通过多语言共识研究 LLM 中更多与语义相关的内部组件,并通过构建依赖于文本的联合语义集并计算此共享维度子集的相似性,从静态表示空间转向动态的、特定于样本的语义维度。各种 LLM 的广泛实验表明,我们的方法始终优于最近的基线,同时保持较低的相似性计算维度。代码发布于 https://github.com/szu-tera/DySem。