论文
重新审视大模型评判的有帮助程度:跨辅导模型的预注册审计
Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across Tutor Models
摘要
大模型辅导存在测量问题:通用有帮助程度评分能否区分直接给出答案与教学引导?预注册研究在三种辅导基础模型内部比较同底层模型实现的会话策略与教学策略,每组配对一个固定、较弱的模拟学生。确定性检测器衡量答案泄漏及下一轮独立作答。冻结且不知道实验条件的 Claude Opus 4.8 为主评判模型;其评分固定后,研究预先指定 GPT-5.6 Sol 对相同 1179 个确认性答案阶段回合进行事后稳健性审计,使用冻结评分标准。主基础模型在 Opus 下的有帮助程度没有显著策略差异,教学标准却完全区分排序,Cliff 效应量绝对值分别为 0.10 与 1.0。两种评判模型中,检测到的教学差异方向保持一致,而有帮助程度排序依赖评判模型,在三个基础模型中的两个上发生逆转。仅使用 Opus 的消融中,七种策略的教学平均分跨度为 2.3 分,而有帮助程度仅跨 0.25 分。所有基础模型在直接揭示答案的回合后,学生独立作答均减少;该指标按构造不依赖评判模型。受控结果表明通用有帮助程度不是可靠的教学信号,辅导评估应结合教学专门标准与确定性过程指标。