论文
确认正确的、漏掉其余的:LLM辅导智能体在反馈最关键处失手
Confirming Correct, Missing the Rest: LLM Tutoring Agents Struggle Where Feedback Matters Most
摘要
有效的辅导需要区分学生的最优解、有效但次优的解与错误解,这一区分是智能辅导系统(ITS)的核心,但对基于LLM的辅导者尚未经过检验。随着LLM越来越多地被探索用作ITS的对话式补充,评估其诊断精度至关重要。我们提出一个包含七个LLM反馈智能体的命题逻辑基准,使用源自知识图谱的黄金标准,覆盖10,836个解-反馈对与三种反馈条件。模型在最优步骤上取得接近满分的成绩,却系统性地错误拒绝有效但次优的推理,并错误认可错误解——而这恰恰是自适应辅导最关键之处。这些失败跨越所有模型、与解的上下文无关,暗示这是架构性而非信息性的限制。此外,准确的诊断并不能可靠地产生教学上可操作的反馈,揭示出诊断判断与教学效果之间的鸿沟。我们的发现表明,LLM更适合用于混合架构:由知识图谱(KG)接地的模型负责诊断,LLM则支持开放式支架式教学与对话。
