论文
LLM 已经是好导师:无需训练 教学数学辅导的提示优化
LLMs Are Already Good Tutors: Training-Free Prompt Optimization for Pedagogical Math Tutoring
摘要
协调 LLM 进行数学辅导通常需要基于 RL 的训练与多 GPU 基础设施。我们研究了 无需训练 提示优化(仅通过 API 调用改进系统提示)是否可以作为实用的替代方案。我们采用了 7 种已发布的方法,并提出了 5 种教育专用方法,在 2 个 OOD 基准套件的 5 种条件下评估了这 12 种方法。所有 12 种最佳方法配置都超过了最强的 RL 训练基线 (R_total = 0.633),并且我们的 ParetoGrad 在测试后解决率、泄漏控制和有用性方面实现了最佳帕累托平衡,而不是主导任何单个组件。使用 82 代码教育密码本进行的行为分析表明,无需训练 方法对教学知识模式的依赖程度是 RL 训练模型的 2-3 倍,并且意图级支架减少了约 10 个百分点。我们还发现任务依赖推理模式在 无需训练 和基于 RL 的范式中效果一致。我们的方法可以仅通过提示和最少的计算来高效开发符合教学法的 LLM 导师。