论文
自我监督技能优化
Self-Supervised Skill Optimization
摘要
代理技能为冻结的 大语言模型 (LLM) 代理提供可重用的程序指导,最近的工作表明,可以通过 真值 (GT) 反馈来优化此类技能。然而,许多应用程序缺乏 GT 标签、任务分数、奖励或可靠的特定任务评估器。因此,我们引入了自我监督技能优化(SSO),这是一个比较框架,仅从未标记的任务实例中学习可重用的技能。在每个步骤中,SSO 都会在未标记的批次上运行当前技能,使用结果执行的子集生成完整的技能探针,并在同一批次上运行探针。 LLM 法官会比较结果答案、轨迹、工件或最终状态。单独的行为提取器无需查看法官的决定即可识别行为差异。 SSO 使用这些决策来汇总支持和反对跨实例观察到的行为的证据。然后,它根据结果证据对行为进行排名,并从排名最高的行为中得出新的完整技能。仅当新技能在未标记的验证集上优于当前技能时,才会接受更新。 SSO 在封闭式和开放式任务上都优于现有的无 GT 提示优化器。在封闭式基准测试中,它接近甚至有时超过了最强的基于 GT 的技能优化器,而无需使用任何 GT 反馈。