论文
APTER:基于专家锚定评分量规的自适应后训练
APTER: Adaptive Post-Training with Expert-Grounded Rubrics
摘要
随着大语言模型进入专业领域,它们必须满足领域约束、包含关键证据并提供完整推理,而不仅仅是生成流畅的回答。现有后训练方法通常依赖整体偏好或结果级验证,而近期基于量规(rubric)的方法通常为每个查询独立生成量规。在专业领域,这种不受约束的量规可能遗漏关键要求,且在不同样本间变化,妨碍对持续性能力缺陷的诊断与针对性修复。我们提出APTER(Adaptive Post-Training with Expert-Grounded Rubrics),一个将结构化领域知识融入专业复杂推理的细粒度评估、优化与诊断的框架。首先,专家锚定的量规构建从领域专家构建的专家准则框架出发,其中每条准则代表一项稳定的专业能力。对每个查询,APTER选择相关准则并将其实例化为与源准则关联的查询级量规,把可复用的专家准则转化为无需参考答案的可执行查询级监督。其次,自适应后训练将量规裁决同时用作优化与准则级诊断信号。按准则ID聚合低分裁决可揭示持续性缺陷,并在强化学习期间触发针对性的监督微调更新。在数学推理和医学问答上的实验显示两个领域均有一致增益。跨越三代模型,APTER将数学和医学平均分较相应基座模型最多提升15.86分和8.04分。代码与量规数据集见 https://github.com/AntDT-APTER/APTER。
