论文

用于预测跨语言模型家族的训练反应的目标无关的微干预

Target-Independent Micro-Interventions for Predicting Training Response Across Language-Model Families

模型评测评测方法与指标

摘要

基准分数描述了检查点现在可以做什么,但它们并不能确定它将如何响应下一个训练集。我们通过从同一检查点分支四个简短的、标准化的、与目标无关的微干预措施并在公共能力空间中记录它们的效果来测量这种缺失状态。这些响应与当前能力一起形成 L 状态;其脉冲块支持灵活的直接读出和结构保持运算符读出。在平滑的局部动态下,算子构造允许具有显式源族和目标族坐标异质性的端到端跨族界限。在三族留一族开发中,两种脉冲读数相对于单独的能力而言,将源标准化 MSE 降低了 39.4%,同时将最佳响应和方向估计分开。在密封的 GLM-4-9B 上,直接读数和算子读数分别将 MSE 降低了 71.8% 和 78.3%,并且算子读数将符号平衡精度从 0.366 提高到 0.754。在密封的 Granite-3.1-8B 上,直接读数达到 RMSE 0.544,开发安装的动作选择器达到 0.554,而单独的能力为 1.172。五族审计发现操作员坐标因动作和族而异,并且对这些偏差进行建模可以改进回顾性保持轨迹预测。因此,与目标无关的干预措施可以通过涵盖补充转移机制的直接和结构化读数来暴露当前能力遗漏的训练响应信息。