论文
STELLAR-E:合成、定制、端到端的 LLM 应用严格评估器
STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator
摘要
各行各业对大语言模型(LLM)的依赖日益加深,凸显了对可靠的领域特定与语言特定评估数据集的需求;然而,受隐私顾虑、监管限制以及人工构建的时间成本影响,此类数据集的收集颇具挑战。现有的自动化基准测试方法往往受限于依赖既有数据、可扩展性差、聚焦单一领域以及缺乏多语言支持。我们提出 STELLAR-E——一个全自动系统,仅需极少的人工输入、不依赖既有数据集,即可生成自定义规模的高质量合成数据集。该系统由两个阶段构成:(1)我们改造 TGRT Self-Instruct 框架,构建一个支持可控、定制化合成数据集生成的合成数据引擎;(2)一套评估流水线,融合统计指标与基于 LLM 的指标,用于评估合成数据集在基于 LLM 的应用评估中的适用性。与既有语言特定基准相比,合成数据集在 LLM-as-a-judge 分数上平均相差 +5.7%,表明其质量足以支撑对大型与小型的 LLM 进行全面评估。尽管真实数据集对 LLM 而言仍略具挑战性(对小模型尤其如此),这项工作建立了一个可扩展、可适配领域的基准测试框架,支持对 LLM 应用的公平评估,为人工方式提供了更快速的替代方案,并使高效的自动化质量保障循环成为可能。
