论文
面向基于LLM的自动评分的混淆感知量规优化
Confusion-Aware Rubric Optimization for LLM-based Automated Grading
摘要
准确且无歧义的评分指南对基于大语言模型(LLM)的评分器至关重要,但人工撰写这些提示往往并非最优,因为LLM可能误解专家指南或缺乏必要的领域特异性。因此,该领域已转向自动化提示优化,以便在没有人工试错负担的情况下精炼评分指南。然而,现有框架通常把相互独立、非结构化的错误样本聚合为单次更新,导致“规则稀释”——相互冲突的约束削弱模型的评分逻辑。为解决这些局限,我们提出混淆感知量规优化(CARO),一个通过结构性分离错误信号来提升准确率与计算效率的新框架。CARO利用混淆矩阵把单体错误信号分解为不同模式,从而逐一诊断和修复特定的误分类模式。通过为占主导的错误模式合成有针对性的“修复补丁”,并采用多样性感知的选择机制,该框架防止指导冲突,并免除了资源密集的嵌套精炼循环。在教师教育与STEM数据集上的实证评估表明,CARO显著优于现有SOTA方法。这些结果表明,用外科手术式的、按模式修复取代混合错误聚合,能在自动评估的可扩展性与精确度上带来稳健提升。
