论文
学习高效评分:用于低成本 LLM 作文评分的 Bandit 驱动的提示选择框架
Learning to Grade Efficiently: A Bandit-Driven Prompt-Selection Framework for Low-Cost LLM Essay Scoring
摘要
大语言模型 (LLM) 在自动论文评分 (AES) 方面表现出强大的能力,但当代方法通常采用固定的提示选择,无法解决运营成本问题并不断发展最佳配置。我们提出了一种新颖的成本感知方法,将每种提示类型视为多臂老虎机(MAB)控制器中的一个臂,从而能够在推理过程中自适应选择最佳提示策略。我们对雅思写作任务 2 论文的实验表明,MAB 框架实现了与详尽网格搜索相当的评分准确性,同时将 LLM 调用减少了 78.4%,以找到最佳评分方法。我们实施了四种不同的评分方法(多步与单步评估、有校准示例与无校准示例),并发现带有示例的多步骤方法可实现最高的准确度。通过跟踪词元使用情况和延迟以及协议指标,我们为论文评分生成了第一个成本可靠性学习曲线,为必须平衡运营成本和评估有效性的教育技术平台提供了可行的见解。这项工作代表了在线控制机制在 AES 中自适应选择提示策略的首次应用,将提示选择从离线超参数优化问题转变为高效的在线学习任务。