论文
从执行到教育:LLM 中测量教育控制的布鲁姆对齐框架
From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs
摘要
我们在 大语言模型 (LLM) 中引入了一个与 Bloom 一致的框架,用于测量教育控制:保留任务的教学意图,同时将其认知需求转向指定学习目标的能力。我们将该框架应用于计算机科学教育中的编程任务,以研究解决任务和适应学习者之间的差距。使用修订后的布卢姆分类法作为认知需求的操作尺度,我们评估了两种干预设置:一般难度控制,其中模型被要求使任务变得更难或更容易,以及布卢姆控制,其中模型被要求以更高或更低的布卢姆水平为目标。我们评估了匹配的 Qwen3-Next 模型对,在三个基准测试的 2,520 个任务中将 Qwen3-Next-80B-A3B-Instruct 与 Qwen3-Coder-Next 进行比较。该框架揭示了强大的方向不对称性:两种模型都可靠地增加了认知需求,但难以降低认知需求。我们通过语义增量聚类和分层费舍尔判别比探测进一步表征这些结果。在这个受控比较中,通用模型对于一般难度和布隆控制对比显示出更清晰的中层可分离性,而编码器模型对于一般难度表现出较弱的可分离性,而对于布隆控制对比则显示出更深的峰值。这些结果表明,强大的执行绩效并不自动意味着与布鲁姆一致的教育控制。