论文

优化用于基于LLM的自动评分的上下文示例

Optimizing In-Context Demonstrations for LLM-based Automated Grading

上下文与知识上下文工程

摘要

对学生开放式作答的自动评估是规模化个性化反馈教育的关键能力。虽然大语言模型(LLM)已通过上下文学习(ICL)在评分任务中展现前景,但其可靠性严重依赖少样本示例的选择与高质量理由的构建。标准检索方法通常基于语义相似度选择示例,这往往无法捕捉量规遵循所需的微妙决策边界。此外,人工撰写引导这些模型所需的专家理由可能是重大瓶颈。为解决这些局限,我们提出GUIDE(Grading Using Iteratively Designed Exemplars),一个把自动评分中的示例选择与精炼重构为聚焦边界优化问题的框架。GUIDE在选择与精炼的连续循环中运行,采用新颖的对比算子识别语义相似但评分不同的“边界对”。我们通过生成区分性理由来增强示例,这些理由明确阐述为何一份作答获得特定分数而非相邻分数。在物理、化学与教学内容知识数据集上的大量实验表明,GUIDE显著优于标准检索基线。通过把模型注意力聚焦于量规的精确边缘,我们的方法在边界案例上展现出格外稳健的增益以及更高的量规遵循度。GUIDE为可信、可扩展且与人类教学标准紧密对齐的评估系统铺平道路。

优化用于基于LLM的自动评分的上下文示例
图1:GUIDE 算法的概览。