论文
用于科学文档表示的非对称文档内预测学习
Asymmetric Within-Document Predictive Learning for Scientific Document Representation
摘要
我们使用论文的话语结构研究科学文档表示的预测预训练。我们提出了 SciJEPA,一个通过非对称文档内预测进行学习的无引用框架:标题和摘要表示用于预测方法表示,方法表示用于预测结论表示。 RELISH、高影响力引文、SciDocs 和引文预测的实验表明,简单的预测训练是可行的,但弱于使用相同部分对的受控对比基线。添加切片各向同性高斯正则化 (SIGReg) 可以显着提高性能并缩小这一差距。正则化的效果取决于任务:适度的 SIGReg 有助于细粒度排名,而较强的正则化会削弱局部对齐。我们进一步表明不同的编码分支支持不同的检索机制。这些结果将文档内预测学习定位为科学文档表示的有前景的无引用补充,前提是嵌入几何图形得到仔细控制。