论文

通过类比教学:教育类比生成的模块化管道

Teaching Through Analogies: A Modular Pipeline for Educational Analogy Generation

模型评测评测方法与指标

摘要

类比帮助学习者通过将不熟悉的概念与已知概念联系起来来理解它们。尽管最近取得了进展,大语言模型 (LLM) 仍然在努力生成与人类产生的质量相当的类比。我们提出了一个用于教育类比生成的模块化管道,将任务分解为四个阶段:源查找、子概念生成、解释生成和评估。该流程以结构映射理论为基础,能够系统地、逐步地​​分析模型选择和输入配置如何影响类比质量。我们在两个具有结构化子概念注释(SCAR 和 ParallelPARC)的数据集上评估了 6 个模型系列中的 12 个最先进的 LLM,以及用于封闭设置检索的 7 个嵌入模型。我们的结果表明,子概念大大提高了解释质量和封闭设置检索精度,但在开放源代码生成中提供的好处有限。我们进一步引入了 LLM-as-a-judge 评估方法,并根据七个注释者的人类注释验证了其评分,发现 Claude Sonnet 4.6 与人类排名的一致性比细粒度绝对分数更可靠。总而言之,我们的研究结果揭示了孤立研究无法捕获的跨阶段相互作用,并强调了子概念基础是类比质量生成的关键驱动因素。