论文
明确的信息需求描述改善大模型相关性判定
Formalized Information Needs Improve Large-Language-Model Relevance Judgments
摘要
克兰菲尔德式检索评估相关文档太少或太多,或者评估者之间对相关性的一致性较低,可能会降低观察的可靠性。在人工评估员的评估中,信息需求通常被形式化为检索主题,以避免过多的相关文档,同时保持良好的一致性。然而,使用 大语言模型 (LLM) 作为相关性评估器的新兴评估设置通常仅使用查询,这可能会降低可靠性。为了研究 LLM 相关性评估人员是否受益于形式化信息需求,我们将 LLM 的信息需求综合形式化为遵循先前人类相关性评估的既定结构(即描述和叙述)的主题。我们将使用综合形式化主题的评估器与 TREC 深度学习和 Robust04 2019/2020 版的 LLM 默认仅查询评估器进行比较。我们发现,未经形式化的评估者会判断更多相关文档,但一致性较低,导致检索评估的可靠性降低。此外,我们表明,形式化的主题提高了人类和 LLM 相关性判断之间的一致性,即使这些主题与人类对应的主题并不高度相似。我们的研究结果表明,LLM 相关性评估人员应该使用形式化的信息需求,作为人类评估的标准,并在不存在人类形式化的情况下综合形式化主题,以提高评估的可靠性。