论文
PETRA:转换网络文本以适应石油工程领域
PETRA: Transforming Web Text for Petroleum-Engineering Domain Adaptation
摘要
石油工程搜索暴露了强通用 检索器 的监管缺口:公共网络文本中存在相关证据,但领域相关标签稀缺。为了解决这一差距,我们提出了 PETRA,一种用于检索适应数据集和管道的大规模石油工程文本,可将嘈杂的公共网络数据转换为精心策划的领域语料库和综合监督,以进行密集检索和重新排名。 PETRA 包含 136 万个策划块、大约 2B 个词元等价物、$\大约 $859k、嵌入来自 $\大约$224k 锚点的训练行,以及大约 400k 个教师评分的重新排序候选行。其构造结合了高召回率能量域管理、测试准确率达 98.4% 的能量域分类器、基于块的查询生成、LLM 编写的硬负例以及检索挖掘的候选列表。 PETRA 通过分数融合将第一阶段域内归一化贴现累积增益 (nDCG) 从 0.703 提高到 0.763。 Reranker 适应将公共地球科学基准相对提高了 44%,将六任务推理密集型面板提高了 23%。失败的训练方案表明,合成标签上的高训练保持准确度并不能预测检索增益;检索挖掘的数据只有在重新打包为从推理时间候选分布中采样的教师评分候选列表后才有用。