论文

专家指导下生成有效情境专用基准的框架

A Framework for Generating Valid Context-Specific Benchmarks through Expert Guidance

模型评测评测方法与指标

摘要

本文提出了一种端到端方法,通过将专家输入与合成数据生成相结合来生成上下文特定的大语言模型(LLM)基准数据集。现有的基准构建方法通常会在有效性和可扩展性之间进行权衡:由领域专家设计的数据集可以产生高质量的评估,但创建速度慢且成本高,而综合生成数据可以有效地扩展,但通常会导致不切实际、冗余或超出范围的示例。为了解决这一差距,我们引入了一个模式,该模式可以得出有关评估任务的目标、范围和上下文的关键信息,并使用这些信息来指导合成数据的生成。我们进一步定义了基于评估数据集质量的测量有效性的四个标准:覆盖范围、多样性、内容真实性和风格真实性。使用这些标准,我们展示了专家知情的支架如何指导合成数据生成以获得更有效的基准。通过定量评估和与领域专家的实际案例研究,我们证明我们的方法比现有方法提高了基准数据质量,同时保持了有效性。我们还分析了不同类型的模式信息如何影响不同的数据集质量标准,并就在资源限制下优先收集哪些信息提供实用指导。

专家指导下生成有效情境专用基准的框架:论文配图
图2:各模式字段对四项数据集质量指标的贡献占比。覆盖度和内容真实性最受特定字段影响,其次是多样性,风格真实性不依赖某个特定字段。在社会工作情境中,未明确系统化实例或全部组成要素时,覆盖度平均可能下降9%。