论文

CWM:面向具身智能体管线中动作可行性学习的对比世界模型

CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines

模型训练监督微调与指令调优

摘要

可靠的动作可行性评分器是具身智能体管线的关键瓶颈:在任何规划或推理发生之前,智能体必须识别哪些候选动作在当前状态下物理可执行。现有方法用监督微调(SFT)训练动作评分器,但 SFT 独立对待每个候选,并未显式教模型区分物理正确的动作与细微错误的动作。我们提出对比世界模型(CWM),用带难挖掘负样本的 InfoNCE 对比目标微调大语言模型(LLM)作为动作评分器。关键思想是在评分空间中把有效动作与无效动作推开,特别强调难负样本:语义相似但物理不兼容的候选。我们在 ScienceWorld 基准上通过两项研究评估 CWM。第一,在 605 个难负样本测试对上的内在可供性评估中,CWM 在最小编辑负样本——一个词改变物理结局的情形——上的 Precision@1 比 SFT 高 6.76 个百分点,AUC-ROC 更高(0.929 对 0.906)。第二,一项在线过滤器特性研究测量 CWM 在任务执行期间对金标准路径动作相对所有有效环境动作的排序能力。在分布外压力条件下,CWM 保持明显更好的安全边际(-2.39 对 SFT 的 -3.96),表明金标准动作排名更接近顶部。这些结果支持如下假说:对比训练诱导的表征比单纯 SFT 更忠实地捕捉物理可行性。

CWM:面向具身智能体管线中动作可行性学习的对比世界模型
图1:CWM 训练流水线。在每个训练步骤中,一个状态及其 gold-valid 动作构成正样本对。从环境反馈日志中挖掘最多 N=16 个难负例(hard negatives),并按失败类型分类。InfoNCE 损失训练 LLM 评分器同时将正样本排在所有负样本之上,而不是像 SFT 那样独立地对每个样本对进行分类。