论文

模拟学生还是阿谀奉承地解决问题?关于LLM模拟器的误解忠实性

Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators

模型评测评测方法与指标

摘要

大语言模型(LLM)可以流畅地生成类似学生的反应,这使得它们作为模拟学生来训练和评估人工智能导师和人类教育者具有吸引力。然而,这种模拟器通常是根据与真实学生的输出相似度来评估的,而不是根据他们在交互过程中是否表现得像具有连贯误解的学生一样来评估。我们引入了一个用于评估误解 忠实性 的受控框架,即模拟器是否维持误解驱动的信念状态并在反馈解决潜在误解时选择性更新。我们框架的核心是误解对比反馈协议,它将目标反馈与两种控制进行比较:错位反馈(针对不同但合理的误解)和一般反馈(仅识别答案是错误的)。我们提出了选择性翻转分数(SFS),它量化了模拟器在有针对性的反馈下比在对比控制下翻转其答案的频率。在七个 LLM (4B-120B)、多个数据集和提示策略中,模拟器表现出接近零的 SFS,无论反馈相关性如何,都以类似的高速率纠正答案。进一步的分析揭示了一种阿谀奉承的失败模式:模型的行为不太像有误解的学生,而更像是问题解决者,他们将任何纠正信号视为放弃模拟信念并从内部知识重新解决的线索。为了解决这个问题,我们开发了一个 后训练 管道,涵盖监督 微调 (SFT)、偏好优化和强化学习 (RL),并具有与 SFS 一致的奖励; SFT 产生高达 +0.56 的显着增益,并且 SFS 对齐的 RL 提供了比偏好优化更一致的改进。我们的结果确立了对 忠实性 的误解,认为它是一种具有挑战性但可训练的属性,推动了从静态输出匹配向交互式、有信念意识的学生建模的转变。