论文
StressEval:大语言模型 中知识密集型推理的故障驱动动态基准测试
StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models
摘要
LLM 的静态基准越来越受到污染和过度拟合的影响,尤其是在知识密集型推理任务上。虽然最近的动态基准可以减轻陈旧性,但它们通常会以牺牲可回答性和可控性为代价增加难度。在本文中,我们提出了 StressEval 一个故障驱动的数据合成框架,它将观察到的模型故障转化为动态的具有挑战性和可控的测试实例 StressEval 包含三个阶段,首先它构建一个半结构化难度卡,识别失败的推理步骤及其根本原因,然后应用一种双视角实例合成方法,针对知识差距和推理故障,同时保留潜在的难度因素,第三,它应用门控机制仅保留有根据的明确实例 从多个知识密集型推理数据集开始,我们使用 StressEval 来构建 Dynamic OneEval 一套具有挑战性的动态基准的集中套件 跨越几种最先进的 LLM Dynamic OneEval 产生比原始基准更大的性能下降,同时保留明确的难度因素,从而实现更可操作的迭代