论文
用于迭代问题解决建模的数据集
A Dataset for Modeling Iterative Problem-Solving
摘要
通过重复尝试解决问题是一项顺序建模任务:在每一步,求解器都会收到反馈并决定如何修改其解决方案。预测每次尝试中的表现是否有所改善、停滞或倒退对于理解人类学习者和自主代理的任何迭代问题解决过程至关重要。除了结果之外,对持续存在的错误以及策略如何在尝试中转变进行建模可以更深入地了解顺序学习的机制。研究这些动态需要观察许多求解器的尝试、接收反馈和修改。具有自动评分功能的编程课程提供了这种设置,因为学生反复向测试套件提交代码并收到每次尝试的反馈。因此,我们策划了 CodeInsight,这是一个大型数据集,包含 3,286 名本科生在 2 个学年的 2 门 C++ 入门课程中提交的超过 300 万份提交内容,其中包含测试用例级别的结果、时间戳和源代码。在此数据集上,我们构建了一个基准,在共享校准和评分协议下评估跨越参数、顺序和生成传统的模型,包括适合通过离散潜在变量跟踪求解器特征的循环状态空间模型(RSSM)和生成显式解决方案的基于 LLM 的预测器。改编后的 RSSM 在四门课程中的三门中实现了最强的预测准确性。 LLM 预测器不太准确,但每次尝试都会生成完整的提交内容,从而能够直接分析故障模式。我们发现模型的编码熟练程度与在此设置中的预测性能成反比,LLM 更好地理解为以上下文为条件的生成求解器,而不是求解器行为的忠实预测器。我们根据要求公开发布我们的代码和数据集,以促进未来的研究。