论文
首届Teaching Monster Challenge结果:面向AI智能体教学内容知识(PCK)的基准
Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents
摘要
AI智能体如今能够解决问题、像学科专家一样作答,并生成长篇多模态内容。然而,它们能否把一节课调整得适合特定学习者——教育学称之为教学内容知识(Pedagogical Content Knowledge, PCK)——尚未被基准化测量。为测量这一能力,我们提出Teaching Monster Challenge,首个将学习者画像作为显式评测标准的教学视频生成基准。每个系统会得到一个主题和一个学习者画像,并须生成完整的教学视频。每个视频先由LLM裁判初筛,再经众包两两投票排序,最后由专家小组定评。首届结果显示,当今系统对内容的处理较好,但在呈现内容并将其适配到学习者方面明显较弱。同一流程也暴露了自动评判的局限:LLM裁判能区分出明显的低分尾部,但对最强系统的排序很差。最强系统从裁判处获得几乎相同的分数,因此裁判对它们的排序与人类偏好不符。因此,进步不仅需要更好的教学系统,也需要更好的自动裁判;我们发布该基准、评分量规与人工评判结果,作为二者的试验平台。
