论文
VASO:物理人工智能代理的可正式验证的自我进化技能
VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents
摘要
可重复使用的机器人技能正在成为具体代理将开放式指令转化为长期物理行为的基本单元。我们认为,虽然基础模型降低了创造这些技能的成本,但信任它们的成本却没有降低。现有的技能进化循环通过执行反馈、单元测试、环境奖励或 LLM 自我批评来完善技能,但这些信号仅提供跟踪级别的证据:它们表明技能在采样执行中起作用,而不是技能诱导的计划在未经测试的条件下满足临时安全契约。我们引入了 VASO,这是一个用于 LLM 生成的机器人技能合约的验证引导自我进化的框架。在 VASO 中,每项技能都表示为具有两个耦合接口的语义契约:一个将机器人状态、观察和控制命令与模型检查的逻辑命题对齐的正式接口,以及一个指导可执行行为生成的面向规划者的接口。模型检查器首先过滤逻辑上不一致的技能合同,然后根据全局和本地时间规范验证由技能引发的计划。当验证失败时,VASO 会将反例跟踪转换为文本梯度,更新可重用的技能契约,同时保持基础模型权重冻结。在 Clearpath Jackal 和 PX4 四轴飞行器任务中,VASO 使用少于 100 个优化样本达到了 97.2% 的正式规范合规性,优于执行反馈、提示优化和 微调 基线。据我们所知,VASO 是第一个在形式验证与物理 AI 代理的自我进化 LLM 生成技能之间建立闭环的框架:形式反例成为可重用机器人技能合约的优化反馈,而不仅仅是验证一次性计划、调整规划器提示或 微调 模型权重。