论文
学习折叠:LeHome Challenge 2026 获奖解决方案(线上第一名,线下第二名)
Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)
摘要
我描述了我对 LeHome Challenge 2026 的解决方案,这是 ICRA 2026 的双手服装折叠竞赛。该系统在在线(模拟)回合中将 62 支队伍中的排名第一,在现实世界决赛中排名第二。它通过强化学习循环改进了视觉-语言-动作(VLA)策略。该策略是它自己的价值函数:预测行动的同一网络还可以预测成功、进度和一些与任务相关的未来量,而这些预测驱动优势估计、实时故障检测和候选者选择。这项工作主要将现有的 RL 思想与工程和优化贡献重新结合起来,这些思想可以作为一个方案一起使用,也可以单独使用:AWR + RECAP 组合用于流量匹配 VLA;通过 HuggingFace Hub 的异步分布式训练/轨迹生成管道;通过汤普森采样进行推理时间超参数优化;具有相机对准工具、大量增强和类似 DAgger 的 HIL 数据收集的模拟到真实配方。