论文

正确的诊断,更好的反馈:逻辑证明中忠实的大语言模型辅导反馈的符号验证器

Correct Diagnosis, Better Feedback: A Symbolic-Verifier for Faithful LLM Tutoring Feedback in Logic Proofs

模型推理推理验证与自校正

摘要

有效的大语言模型辅导取决于在生成反馈之前正确识别学生推理中的具体错误。我们在命题逻辑证明辅导中研究这个问题,可以根据形式推理规则检查学生的行为。我们引入了一种基于验证者的架构,将诊断与语言生成分开。使用 600 个平衡的学生动作,我们比较了零样本 LLM 检测器、微调检测器和符号验证器。每个诊断都由共享的基本原理和反馈代理进行处理,从而隔离初始诊断的影响。零样本探测器的宏F1达到0.191;微调将其提高到 0.709,但保留结构相关类之间的系统误差。基本原理通常会保留提供给他们的诊断,表明错误的诊断可以通过管道忠实地传播。反馈同样可以忠实于其基本原理、不泄露信息且在教学上适当,同时解决错误的错误。基于验证者的反馈实现了最高的诊断正确性,而专家评分与自动反馈评估的结果很大程度上不一致。这些发现表明,明显的反馈质量可以掩盖上游诊断错误,并且必须将忠诚度与正确性分开评估。我们的代码是公开的