论文
面向教育应用的LLM提示评估
LLM Prompt Evaluation for Educational Applications
摘要
随着大语言模型(LLM)在教育应用中日益普遍,越来越需要基于证据的方法来设计与评估能产出个性化且符合教学对齐输出的 LLM 提示。本研究提出一种可推广、系统的提示评估方法,并通过结构化对话活动中 LLM 生成的追问问题分析加以演示。我们设计并测试了六个提示模板。模板纳入成熟的提示工程模式,每个提示强调不同的教学策略。提示模板通过一个可适配其他教育应用的锦标赛式评估框架进行比较。锦标赛采用 Glicko2 评级系统,由八名裁判沿格式、对话支持与对学习者的适宜性三个维度评估问题对。数据来自三个不同教育部署中的 120 个真实用户交互。结果显示,与策略性阅读相关的一个提示胜过其他模板,其两两比较胜出概率介于 81% 到 100%。该提示结合了 persona 与 context manager 模式,旨在支持自主学习等元认知学习策略。该方法学展示了教育技术研究者如何系统评估并改进提示设计,从临时的提示工程走向基于证据的教育应用提示开发。