论文
VeriFine:扩展验证以支持具身推理自改进
VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning
摘要
自我改进的策略不断暴露新的失败模式,改变他们的法官必须能够验证的内容。然而,当前的固定法官限制了优化反馈和有用的训练示例的发现,限制了进一步的自我改进。这一挑战在具身推理中更为严峻,可靠的评估必须考虑空间基础、因果推理和安全意识决策。我们介绍 VeriFine,一个智能体 Harness 框架,它通过策略、训练课程和评委的共同进化来扩展验证。 策略改进循环使用评分标准来诊断重复出现的故障、构建自适应课程并优化策略。当进展停滞且验证成为瓶颈时,法官改进循环有选择地询问人类对信息丰富的失败案例的指导,并通过协同校准来完善法官,其中人类和智能体解决分歧并朝着物理推理的客观规则收敛。修改后的判断再指导下一阶段的数据选择和策略优化。驾驶和机器人导航任务的实验证明了策略的持续自我改进以及强化和监督微调的判断能力。这些结果表明,随着策略故障模式的发展,扩展验证如何支持持续的自我改进。
