论文
NoRA:评估视觉第一人称规范行为推理中的扎根合理性
NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning
摘要
LLM 和代理系统越来越多地部署在社会环境中,使得规范能力对于安全和适当的行为至关重要。然而,现有的方法要么仅评估文本中的规范判断,要么将其简化为在一组固定的候选行为中进行选择。我们认为两者都是不够的。在实践中,Agent永远不会得到一个选项菜单;他们必须从头开始确定合理的行动,以可见的事实为基础,并有可检查的理由支持。我们引入了 NoRA,一种视觉第一人称视频基准,它需要模型生成候选的下一步动作,并通过明确的事实-原因-动作支持图来证明每个动作的合理性。该基准测试包含 1,420 个带注释的视频剪辑,包括 HumanGold-190 和 LLMSilver-1230 分割。每个实例都通过行动对齐、事实基础和支持绑定进行评估,汇总成一个单一的合理性分数。我们在直接、深思熟虑和结构化的提示机制下对 12 个多模式系统进行了基准测试,发现当前的 VLM 经常恢复合理的动作和相关的场景事实,但始终难以构建完整的合理动作空间并将所选动作与正确的本地支持绑定。 NoRA 使这种差距变得可衡量,将评估问题从模型是否可以选择某个操作转变为是否可以出于正确的可见原因证明适当的操作是合理的。