论文

STaD:用于识别 LLM 中的作文技能差距的支架任务设计

STaD: Scaffolded Task Design for Identifying Compositional Skill Gaps in LLMs

模型评测评测方法与指标

摘要

基准测试通常用作了解不同领域中的 LLM 功能的标准。然而,综合基准分数对 LLM 的构图技能差距以及如何改进这些差距的了解有限。为了使这些弱点显而易见,我们提出了支架任务设计(STaD)框架。 STaD 基于脚手架的概念生成基准任务的受控变化,以逐步的方式引入结构化的增量支持。这种方法不是单独检查故障,而是通过识别模型缺乏的特定推理技能组合来系统地、可扩展地探索模型行为。将 LLM 视为黑匣子,我们对六个不同大小的模型进行的实验揭示了三个推理基准中的多个故障点,并突出了每个模型独特且明显的技能差距。