论文
数学错误纠正中人工智能导师的奖励模型
Towards Reward Modeling for AI Tutors in Math Mistake Remediation
摘要
评估人工智能导师的教学质量仍然具有挑战性:标准 NLG 指标并不能确定回答是否识别错误、支架推理或避免透露答案。对于错误补救的任务,我们从 MRBench 上的人类成对偏好中得出了教学方面的层次结构,并合成了在关键方面(例如错误识别和定位、针对性、支架、可操作性、清晰度和连贯性)不同的最小对比响应对。我们开发并发布了 Bradley-Terry 偏好模型,该模型根据加权和排名进行训练,该模型是根据 MRBench、合成对和数据组合自动创建的。仅使用合成数据,我们的最佳模型在人类偏好测试中达到 0.69 成对精度,并将加权和数据与目标合成组相结合将精度提高到 0.74,在仅使用 0.5B 参数主干的情况下优于更大的通用奖励模型。