论文

FAER:用于语言模型训练后的可审计的实用程序对齐轨迹重播

FAER: Auditable Utility-Aligned Trajectory Replay for Language Model Post-Training

模型训练监督微调与指令调优

摘要

重放选择器通常根据格式反馈、置信度、新鲜度或响应长度对缓存轨迹进行排名,尽管缓存级别的正确性和下游学习器效用是不同的目标。我们将这种选择到学习的差距正式化,并引入 FAER 作为可审计的全轨迹重播框架。其免训练的固定选择器是协议基线; FAER-UTILITY 是安装在不相交校准块上的学习者感知选择器。归一化梯度对齐被报告为基线,而一次性优化器感知虚拟更新提供幅度感知实用程序表面。在加入评估标签之前,审计合同会冻结观察到的字段并重播跟踪。在使用 Qwen2.5-1.5B-Instruct 的 GSM8K 上,匹配的学习者研究报告固定选择器的质量为 0.6329,而统一选择器的质量为 0.5482,格式反馈在 128 次更新下的质量为 0.6037。仅元数据交叉拟合校准在 63,276 个目标运行词元中通过八个种子(中位数 0.6481;配对 95% 间隔 $[+0.079,+0.122]$)达到 $0.6476\!\pm\!0.0139$;其记录的全部成本为 189,642 个词元和 3.48 个 GPU 小时(包括校准)。完成的 FAER-UTILITY 行在 62,844 个目标运行词元和 4.26 个 GPU 小时处达到 0.6624。尽管下游排名不同,但格式反馈选择的记录的正确性为 0.6953,而固定选择器的正确性为 0.3594。完成的比较表面报告了学习者感知的消融、同种子差距、策略优化行和严格的零样本迁移。