论文

NormAct:基准测试具身智能体对未言明社会规范的主动遵循

NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms

智能体系统Agent任务评测

摘要

由多模态大语言模型(MLLM)驱动的具身智能体常能从视觉观察完成日常任务——但目标达成并不能确立它们是否主动尊重未言明的社会规范。既有基准评估显式规范判断或受约束行为——但很少测试智能体是否在普通任务中推断并应用场景相关规范。我们介绍NormAct——550个TongSim场景的基准——其中同一目标允许符合或违反规范的动作序列。规范相关证据嵌入每个场景——而适用规则从目标指令中省略。通过在保持目标与场景固定下渐进增加规范性引导——NormAct测试合规行为是自主涌现还是仅在提示后出现。跨三个MLLM规划器——无引导时目标达成大幅超过规范遵循(67.4%对24.7%)——而广泛引导与规则专属引导都改进合规——表明规划器被提示时常能合规——但不能可靠地自主合规。在固定规划器下——一般规范检索不及规范相关场景描述或生成的规范线索有效——提示识别相关视觉证据比获取一般规范知识更具挑战。NormAct因此支持发展追求日常目标同时主动尊重未言明社会规范的具身智能体。

NormAct:基准测试具身智能体对未言明社会规范的主动遵循:论文配图
图 1:NormAct 测试具身规划者是否主动遵循未明示的社会规范。两条路线均可到达目的地,但只有人行横道路线符合要求。然后,匹配的线索阶梯在没有规范指导、广泛的类别线索和特定规则的情况下评估同一场景,揭示合规行为是否在没有提示的情况下发生或仅在提供指导后发生。