论文
SkillRubric:共同演化多模态Agent行动指导与评审规则
SkillRubric: Co-Evolving Actor Guidance and Evaluator Rubrics for Multimodal Agents
摘要
最近的工作将从过去的交互中提取的可重用技能纳入多模式Agent培训中,为长期规划和工具使用提供程序指导。然而,这些方法中的策略优化仍然主要由稀疏的结果奖励驱动,对中间决策几乎没有提供监督。基于评分标准的奖励通过明确的中间标准解决了这一限制,但可靠的评分标准很难大规模构建,并且通常与参与者遵循的程序脱节。我们观察到,结构良好的技能自然会指定如何行动以及成功执行应实现的目标。基于这一见解,我们引入了 SkillRubric,它通过一致的面向演员的指导和面向评估者的评分标准来代表每项技能。多模式验证者使用屏幕截图和工具输出来评估技能定义的目标,为负责的回合分配完成和进度奖励。我们进一步引入了一种交替共同进化方案,该方案通过在冻结策略下配对rollout和在固定指导下离线修订评分规则来验证指导修订。跨不同多模式Agent基准的实验证明了一致的性能增益,而受控的配对部署进一步表明,进化的技能比以前的版本为规划和工具使用提供了更有效的指导。