论文
NormAct:基准测试具身智能体对未言明社会规范的主动遵循
NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms
摘要
由多模态大语言模型(MLLM)驱动的具身智能体常能从视觉观察完成日常任务——但目标达成并不能确立它们是否主动尊重未言明的社会规范。既有基准评估显式规范判断或受约束行为——但很少测试智能体是否在普通任务中推断并应用场景相关规范。我们介绍NormAct——550个TongSim场景的基准——其中同一目标允许符合或违反规范的动作序列。规范相关证据嵌入每个场景——而适用规则从目标指令中省略。通过在保持目标与场景固定下渐进增加规范性引导——NormAct测试合规行为是自主涌现还是仅在提示后出现。跨三个MLLM规划器——无引导时目标达成大幅超过规范遵循(67.4%对24.7%)——而广泛引导与规则专属引导都改进合规——表明规划器被提示时常能合规——但不能可靠地自主合规。在固定规划器下——一般规范检索不及规范相关场景描述或生成的规范线索有效——提示识别相关视觉证据比获取一般规范知识更具挑战。NormAct因此支持发展追求日常目标同时主动尊重未言明社会规范的具身智能体。
