论文

Mini-BEHAVIOR-Gran:揭示指令粒度对语言引导具身智能体的U形效应

Mini-BEHAVIOR-Gran: Revealing U-Shaped Effects of Instruction Granularity on Language-Guided Embodied Agents

智能体系统Agent任务评测

摘要

指令粒度是语言引导具身AI中重要却缺乏良好控制的变量。现有基准通常为每个任务配一条静态指令,难以研究同一任务以不同细节程度描述时智能体行为如何变化。我们提出Mini-BEHAVIOR-Gran,一个用于指令粒度受控研究的新基准,它扩展Mini-BEHAVIOR,为每个任务提供多条指令变体,从高层目标描述到逐步指导。利用该基准,我们比较了四种跨任务粒度量化的候选指标:token数、实体数、动作动词数和规划宽度(planning-width),发现规划宽度与智能体性能的相关性最稳定。用规划宽度来组织训练与评估进一步揭示,指令粒度与性能之间存在非单调的U形关系,在细与粗两端均出现峰值。进一步分析表明,粗粒度下的性能回升与浅层落地(shallow grounding)有关,即智能体学到以视觉为主的策略。

Mini-BEHAVIOR-Gran:揭示指令粒度对语言引导具身智能体的U形效应:论文配图
图 1:对于相同的任务(清洁 kk 鞋子),粗略指令要求代理推断目标实体和可执行操作。相比之下,细粒度的指令提供了更详细的步骤,显着减少了实现目标所需的语言基础工作。