论文
Xpertbench:基于量规评估的专家级任务
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
摘要
在大语言模型(LLM)于常规基准上的表现趋于平台期之际,一个关键挑战依然存在:如何评估其在体现真正专家级认知的复杂开放任务上的熟练程度。现有框架受制于领域覆盖狭窄、依赖通才任务或自评偏差。为弥合这一差距,我们提出 XpertBench,一个旨在跨真实专业领域评估 LLM 的高保真基准。XpertBench 包含横跨 80 个类别的 1,346 道精心策划的任务,涵盖金融、医疗、法律服务、教育以及双轨研究(STEM 与人文)。这些任务源自领域专家提交的 1,000 多份材料——包括来自顶尖机构的研究者与拥有丰富临床或行业经验的从业者——从而确保出色的生态效度。每道任务使用详细量规(rubric),大多含 15-40 个加权检查点,用以评估专业严谨性。为实现可扩展且与人类一致的评估,我们提出 ShotJudge,一种新的评估范式,它使用经专家少样本样例校准的 LLM 评判器,以缓解自我奖励偏差。我们对最先进 LLM 的实证评估揭示出明显的性能天花板:即便领先模型的峰值成功率也仅约 66%,平均分约 55%。各模型还呈现领域分化,在定量推理与语言综合上展现互不重叠的优势。这些发现凸显了当前 AI 系统中显著的“专家差距”,并确立了 XpertBench 作为引导从通用助手迈向专业化职业协作者的关键工具。
