论文

人工中央凹感知:缓解机器人基础模型的捷径学习

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

模型训练监督微调与指令调优

摘要

机器人基础模型部署前仍需任务特定微调,微调后的策略却容易受场景布局、光照和邻近干扰物的小幅变化影响。论文将这种脆弱性归因于捷径学习:微调监督动作,却不约束策略所用的视觉证据,因此模型可能依赖能预测演示动作、却不导致任务成功的场景相关性。作者提出人工中央凹感知AFP,一个轻量、与策略无关的模块。它接收现有视觉—语言—动作模型和世界动作模型相同的视觉与语言输入,预测相关物体、机器人及其他关键行动区域的任务条件掩码。 微调时,掩码提供辅助视觉定位监督,让策略注意力对齐任务相关区域;策略架构不变,推理仍使用原观察流,控制环路不调用AFP。作者在四个机器人基础模型的仿真中,以及采用π₀.₅的真实机器人上验证:AFP改善环境扰动下的泛化、减少过拟合并缩短微调。掩码质量与视觉定位损失的消融显示,收益来自引导策略学习任务相关的视觉证据。代码、数据和视频见https://apollo-lab-yale.github.io/26-CoRL-AFP-website/。