论文

经表示对齐缓解苏格拉底导师的脚手架坍缩

Mitigating Scaffolding Collapse in Socratic Tutors via Representation Alignment

模型训练偏好优化

摘要

基于大语言模型(LLM)的苏格拉底导师日益经多轮提问引导学生,但可能遭遇脚手架坍缩:在学生的持续压力下,导师逐渐放弃引导式探究、直接透露答案。既往防御主要通过提示、偏好优化或过滤约束可观察响应,对先于轨迹级坍缩的内部表示漂移基本未处理。我们提出保持脚手架的表示对齐,一个两阶段框架:先以监督微调热身苏格拉底导师,再组合轨迹加权的直接偏好优化与锚定到冻结参考态的保边际表示损失。该方法旨在跨对话轮次维持“保持脚手架”与“诱发坍缩”隐状态之间的分离。我们在五个STEM学科与五种红队攻击策略上评估:在Qwen3-8B上,该方法把坍缩率降到32%、平均坍缩起始推迟到九轮以上,同时保持低过度拒绝——表明表示级对齐可在红队协议下改善长程苏格拉底辅导的稳健性。

经表示对齐缓解苏格拉底导师的脚手架坍缩:论文配图
图 2:SPRA 框架概述。 (a) 每回合成对训练数据是根据苏格拉底式对话上下文构建的,通过将选定的脚手架保留响应与五个崩溃类型拒绝响应之一以及轨迹元数据配对。 (b) 通过 LoRA SFT 在正对上获得预热苏格拉底导师,然后将其冻结为参考策略 πref\pi_{\mathrm{ref}};其参考对数概率、池化隐藏状态和全局锚点方向 𝐯^l\hat{\mathbf{v}}_{l} 被预先计算到参考缓存中。 (c) 可训练策略 π𝜽\pi_{\bm{\theta}} 通过联合目标进行优化ℒ总计=ℒSFT+λTDPO​ℒTDPO+λMP​ℒMP\mathcal{L}_{\mathrm{total}}=\mathcal{L}_{\mathrm{SFT}}+\lamb da_{\mathrm{TDPO}}\mathcal{L}_{\mathrm{TDPO}}+\lambda_{\mathrm{MP}}\mathcal{L}_{\mathrm{MP}},其中 ℒSFT\mathcal{L}_{\mathrm{SFT}} 保留苏格拉底式响应生成,ℒTDPO\mathcal{L}_{\mathrm{TDPO}} 通过轨迹加权增加选择-拒绝的偏好边际,ℒMP\mathcal{L}_{\mathrm{MP}} 保留表示边际𝐯^l\hat{\mathbf{v}}_{l}. (d) 通过多轮攻击者-导师-法官红队流程,使用以下指标对训练有素的导师进行评估:崩溃率、平均崩溃起始回合和过度拒绝率。