论文

特工准备好教学了吗?现实世界教学工作流程的多阶段基准

Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows

智能体系统Agent任务评测

摘要

语言代理越来越多地部署在复杂的专业工作流程中,辅导作为一种特别高风险的能力而出现,而在现有的基准中很大程度上仍然无法衡量。有效的导师代理需要的不仅仅是产生正确的答案或执行准确的工具调用:强大的导师必须诊断学习者状态,随着时间的推移调整支持,根据教育证据做出合理的教学决策,并在现实的学习管理系统中执行干预措施。我们推出 EduAgentBench,这是一个基于源的基准,用于在整个教学工作范围内全面评估导师代理。它包含跨越三个能力层面的 150 项质量控制任务:专业教学判断、情境多轮辅导和 Canvas 式教学工作流程完成。任务是通过教学洞察力驱动的管道构建的,并通过补充验证信号和人工审查进行评估。通过对前沿模型的综合评估,我们的研究结果表明,当前模型总体上能够进行有限的教学判断,但在情境辅导和自主教学工作流程执行方面仍低于专业教学标准。据我们所知,EduAgentBench是第一个基于理论和现实的评估导师代理整体教学能力的基准,为未来开发支持现实教学工作的导师代理提供了衡量基础。

特工准备好教学了吗?现实世界教学工作流程的多阶段基准
图 1:源头基准测试设计和验证者匹配评估。 EduAgentBench 将教师级别的准备情况分解为三个特定阶段的衡量合同。每个阶段都从目标教育洞察开始,以外部教育来源、确定性课程数据或 Canvas 式环境状态中的洞察为基础,并附加与任务留下的证据相匹配的验证器。人工审核和轨迹审查验证任务合同并判断一致性,而不是特定于模型的分数。