论文

SAGE:LLM 知识评估的可扩展自动鲁棒性增强

SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation

模型评测基准与评测资源

摘要

大语言模型 (LLM) 在标准知识评估基准上取得了强劲的表现,但最近的研究表明,在以不同形式测试相同知识的问题变体下,它们的知识能力仍然很脆弱。因此,增强现有知识评估基准的稳健性是必要的,但由于低产量的变体生成和不可靠的变体验证,当前的 LLM 辅助生成然后验证管道成本高昂且难以扩展。我们提出了 SAGE(可扩展自动生成稳健性基准),这是一个使用微调的较小模型来增强知识评估基准的可扩展稳健性的框架。 SAGE 由 VariantQual 和 VariantGen 组成,VariantQual 是一个基于人类标记种子数据训练的基于标题的验证器,VariantGen 是一个用监督 微调 初始化的变体生成器,并使用 VariantQual 作为奖励模型通过强化学习进一步优化。 HellaSwag 上的实验表明,SAGE 构建了一个大规模的鲁棒性增强基准,其质量可与人工注释的 HellaSwag-Pro 相媲美,且成本大大降低,而微调后的模型进一步推广到 MMLU,而无需特定于基准的 微调。