论文
LLM4Impact:融合异构证据预测论文影响力
LLM4Impact: Integrating Heterogeneous Information for Scientific Impact Prediction
摘要
预测新发表的论文的未来影响具有挑战性,因为它必须从发表时可用的异质证据中推断出来。现有方法通常依赖于单一信息源或组合多个信息源,而不考虑它们的不同预测作用。在本文中,我们提出了 LLM4Impact,这是一种用于科学影响预测的证据感知方法,可以学习表示、集成和校准异构信息。 LLM4Impact 结合了语义、图、LLM 和时间表示,并通过连续的前缀标记将图信息注入到冻结的 LLM 中。上下文感知门控机制自适应地对不同证据进行加权,而单独的校准模块则考虑了引文量表中的域和时间变化。我们进一步构建了一个包含 200 万篇论文、泄漏安全时间点异构自我图、时间分割以及年级和月级引用目标的大规模基准数据集。实验表明 LLM4Impact 始终优于强语义、图形和 LLM 基于基线,分布测试集上的年 RMSE 降低了 10.13%,域外分布下的年 RMSE 降低了 6.87%。我们的结果表明,此类证据的价值取决于上下文:不同的论文受益于不同的来源,而领域和出版时间会影响证据如何转化为引用。这一发现激发了适应性证据选择和上下文条件校准,而不是简单地更丰富的表示。我们将在发布后发布我们的代码、基准测试和交互式网络演示。