论文
互惠协同训练 (RCT):通过强化学习耦合基于梯度和不可微分的模型
Reciprocal Co-Training (RCT): Coupling Gradient-Based and Non-Differentiable Models via Reinforcement Learning
摘要
语言模型 (LM) 和经典机器学习方法为预测建模提供了互补的优势,但它们根本不同的表示和训练范式阻碍了有效集成:LM 依赖于文本数据的基于梯度的优化,而随机森林 (RF) 等模型则采用不可微分的特征划分。这项工作引入了一个互惠协同训练框架,该框架通过强化学习将 LM 与 RF 分类器耦合起来,创建一个迭代反馈循环,其中每个模型都使用来自另一个模型的信号进行改进。表格数据被重新表述为 LM 的标准化文本表示,其嵌入增强了 RF 特征空间,而校准的 RF 概率估计提供了反馈信号,指导 LM 的强化学习更新。使用适应领域的临床编码器 (ClinicalBERT) 和更大的指令调整语言模型 (Qwen2-7B-Instruct) 进行评估,在三个医学数据集上进行的实验表明,这两个模型组件具有一致的性能增益。消融分析表明,迭代细化、混合奖励设计和维度控制共同促成了这些收益。 SHAP 分析进一步证实,LM 派生的表示是 RF 预测最重要的输入之一。所提出的框架提供了一种通用机制,允许不兼容的模型系列通过双向适应来利用彼此的优势。