论文
利用 大语言模型 建立不完美学生的可控模拟基准
Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models
摘要
教师教育需要对表现出明显优势、劣势和部分掌握的学习者进行刻意练习。 大语言模型 可以通过模拟具有已知技能成分的学生来支持此类实践,使教师能够排练解释、诊断和教学反应。然而,为此目的,核心要求既不是最大化基准准确性,也不是抑制孤立的事实,而是控制模型行为,使其反映指定的技能概况。本文研究了是否可以引导提示语言模型保留某些技能,同时抑制其他技能。我们引入了一个面向基准的框架,其中明确的技能向量代表模拟的学生,基于提示的控制指定保留和缺失的能力,并使用配置文件对齐指标、保留与遗忘的比较和跨技能校准分析来评估行为。结果表明,尽管可控程度仍然取决于模型,但可以在结构化数学环境中诱导和测量选择性部分掌握。这些发现将可控学习者模拟定位为教师教育、教育模拟和语言模型控制交叉点的一个独特的研究问题。