论文

基于 LLM 的自动评分的可学习评估技能:通过迭代优化构建Rubric

Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization

模型评测智能体系统Agent Skills评测方法与指标

摘要

基于 LLM 的自动评分接近人类的表现,但扩展到新任务仍然受到上游阶段(例如评分标准构建)的每个项目的人工配置的瓶颈。人类专家通过广泛实践中开发的评估启发法绕过了这一瓶颈。我们询问 LLM 是否可以直接从评分经验中学习类似的启发式方法,并将其形式化为评估技能的概念:独立于项目的自然语言程序知识,指导 LLM 通过评分工作流程的特定阶段。重点关注标题构建作为第一个实例,我们提出了一个迭代框架,将技能分解为固定支架和可学习的与项目无关的规则,通过 LLM 驱动的评分错误诊断和验证门控选择来细化规则。该框架不需要专家编写的标题。在所有十个 ASAP-SAS 项目上,优化的技能极大地提高了基于 LLM 的评分,并且经常超过数据集提供的专家评分标准。跨项目迁移实验进一步表明,学到的技能既能捕捉普遍性的模式,又能捕捉特定于项目的模式。