论文
AdviSD:学习通过有针对性的多轮自蒸馏为前沿大语言模型提供建议
AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation
摘要
小型可训练顾问可以使用自然语言建议来引导冻结的语言模型执行器。除了从任务奖励中学习之外,顾问还可以使用已完成交互的反馈来改进其建议。然而,合理的纠正不需要改变执行,但从此类纠正中学习仍然可以影响顾问在其他情况下的未来决策。在共享参数模型中,我们证明,如果这些修正的目标不像其他修正那样强烈地支持有用的建议,那么这种修正可能会限制学习。与从每次修正中学习相比,减少保留它们的频率可以提高模型的最终性能。受此启发,我们的方法顾问自蒸馏(AdviSD)将基于结果的强化学习与选择性地从顾问的反馈条件副本中进行自我蒸馏配对。反思提出更正,顾问在有或没有发布建议的情况下对记录的执行者响应进行评分,并使用差异的大小来选择监督决策。这种方法不需要执行者可能性或额外的执行者rollout。对 Gemini 和 Claude 的 Qwen3-8B 顾问进行的实验表明,AdviSD 在 BFCL-v3 上比顾问-GRPO 好 4.2-6.4 个百分点,在 EnvScaler 上比顾问-GRPO 好 3.9-5.1 个百分点。训练有素的顾问可以泛化到域外任务,并在不同的执行器版本和模型系列之间进行转移。 AdviSD 还击败了匹配计数随机选择,支持其选择规则的价值。