论文

通过多智能体编排优化课堂话语的LLM标注

Optimizing LLM Annotation of Classroom Discourse through Multi-Agent Orchestration

模型推理智能体系统推理验证与自校正Agent Harness

摘要

大语言模型(LLM)日益被视为标注教育数据的可扩展工具,包括课堂话语、交互日志和质性学习作品。它们快速概括教学互动并赋予符合量规标签的能力,助长了对降低专家人工标注成本与时间的乐观情绪。然而,越来越多的证据表明,对于需要情境判断、教学判断或规范判断的高风险教育构念(如教学意图或话语举动),单次LLM输出仍然不可靠。规模与效度之间的这种张力正处于当代教育数据科学的核心。在本工作中,我们提出并实证评估了一个分层、成本感知的LLM标注编排框架,它在提升可靠性的同时显式建模计算上的权衡。我们没有把标注当作一次性预测问题,而是将其概念化为一个多阶段认识过程,包括:(1)未经核验的单次标注阶段,各模型依据量规独立赋予标签;(2)自核验阶段,每个模型依据量规定义审计自己的输出,并在发现不一致时修订标签;以及(3)以分歧为中心的裁决阶段,一个独立的裁决模型审查核验后的标签与理由,并依据量规确定最终标签。这一结构对应于教育研究中成熟的人工标注工作流:初始编码之后是自查,再由专家解决分歧。

通过多智能体编排优化课堂话语的LLM标注:论文配图
图 1:TalkMoves 跨编排策略的每个类别的性能。不同注释编排策略下七个 TalkMoves 类别的平均 F1 分数。条形图显示三个LLM(GPT、Claude、Gemini)的平均表现,而标记则表示各个模型分数(形状)。类别通过增加基线难度从左到右排序。