论文
大语言模型教学时会心理化吗?
Do Large Language Models Mentalize When They Teach?
摘要
LLM如何决定下一步教什么:是通过推理学习者的知识,还是使用更简单的经验法则?我们在一个此前用于研究人类教学策略的受控任务中检验这一问题。在每次试验中,教师LLM观察一个假设学习者在带奖励标注的有向图中的轨迹,并须揭示单条边,使得学习者在重新规划时会选择更优路径。我们让一系列LLM担任模拟教师,并用与人类研究中相同的认知模型拟合其逐试验选择:推断学习者缺失哪些转移的贝叶斯最优教师(逆规划)、较弱的贝叶斯变体、启发式基线(如基于奖励的),以及不进行心理化(mentalizing)的效用模型。在与人类被试所见刺激相匹配的基线实验中,多数LLM表现良好,策略在试验间变化不大,且其逐图表现与人类相近。模型比较(BIC)显示,贝叶斯最优教学最能解释多数模型的选择。在给予脚手架干预时,模型会遵循侧重推理或奖励的辅助提示,但这些脚手架并不能可靠地提升其后续在与启发式不一致的测试图上的教学,有时反而降低表现。总体而言,认知模型拟合为理解LLM辅导策略提供了洞见,并表明提示遵从并不保证更好的教学决策。
