论文
后训练 剖析:利用可解释性来表征数据并塑造学习信号
Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal
摘要
语言模型 后训练 是模型行为形成的主要阶段,但它仍然主要涉及总结不同需求的标量奖励的优化。这种抽象使从业者几乎无法了解他们的数据实际上教给模型的内容,从而允许模型学习虚假的相关性并引发不良行为,例如过度程式化和阿谀奉承。为了解决这个问题,我们问:我们能否在优化之前检查偏好数据集,并在概念层面决定模型应该允许学习哪些行为?受此启发,我们引入了一个以数据为中心的 后训练 管道,该管道使用可解释性协议来为区分偏好代和不偏好代的潜在概念开发统计假设,使它们明确用于细粒度的用户反馈。基于这一观点,我们统一了几种基于可解释性的训练协议,作为通过特征或数据干预来塑造奖励的方式。根据经验,我们表明我们的管道可以诊断现有偏好数据中的不良信号,减少脱靶学习,并且还可以帮助放大或塑造所需的属性,例如保障措施和模型个性。更广泛地说,我们的结果表明,可解释性可以将 后训练 从优化不透明代理奖励转变为审核和塑造学习信号本身的过程。