论文
无注释 LLM 自 蒸馏 的神经元感知数据选择
Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation
摘要
没有现实世界交互反馈或人工标记监督的 后训练 大语言模型 (LLM) 仍然具有挑战性,特别是在获得专家注释成本高昂的专业领域。最近的无注释自我进化方法通过使用模型自身的输出作为监督信号来解决这个问题,通过额外的上下文构建教师,并通过多数投票聚合多条执行轨迹的预测以产生伪标签。然而,这些方法并非没有缺点:基于 SFT 和 GRPO 的变体会遭受域外性能下降,而基于奖励的 同策略 RL 会夸大校准误差。在本文中,我们提出了 Neuron 同策略 Self-蒸馏 (Neuron-OPSD),这是一种以数据为中心的无注释 self-蒸馏 框架,利用内部神经元激活来指导训练数据选择和教师上下文构建。然后,该模型通过来自教师分布的 同策略 蒸馏 进行训练,在任何阶段都不需要 真值 标签。在专业领域基准测试中,Neuron-OPSD 提高了域内任务性能,同时保留了跨域泛化并减轻了之前无注释基线上的校准崩溃。该框架特别适用于在线交互或外部监督成本高昂或不可行的环境,并且在概念上与依赖记录、奖励标记轨迹的离线强化学习方法不同。