论文

PetroBench:面向石油工程的大语言模型基准

PetroBench: A Benchmark for Large Language Models in Petroleum Engineering

模型评测基准与评测资源

摘要

大语言模型正日益广泛地应用于石油行业,这凸显了对领域专用评估框架的需求。本研究构建了一个面向石油工程LLM的基准,包括数据预处理、质量过滤与多模型验证的三阶段流程。通过专家审阅,构建了一个领域相关性强、区分能力强的标准化题库。该基准覆盖采油、油藏与钻井工程,共1200道题,涵盖单选题、判断题、术语解释题与简答题四种题型。八个主流LLM在统一API环境下接受评估。结果显示,模型在主观题上的表现优于客观题,表明其在事实性知识辨别上存在短板。单选题与判断题的最高准确率分别为65.3%与74.3%。Gemini-3-Pro、Kimi-K2.5与Claude-Opus-4.6-Thinking取得了72%-74%的最佳综合得分。模型在采油工程上表现最好,在油藏工程上表现最弱。国产模型在单选题上具有优势,而国际模型在简答题上表现略好。该基准为石油工程中LLM的评估与部署提供了可复现且实用的参照。