论文
AFFORDANCE20Q:从物理属性评估可供性推理
AFFORDANCE20Q: Evaluating Affordance Reasoning from Physical Properties
摘要
可供性推理,即从对象的物理属性(例如形状和材料)推断对象的动作可能性,是人类物理理解的基础,并且对于大型语言模型(LLM)越来越重要。然而,现有的可供性基准在评估设置中很大程度上暴露了明确的对象身份,允许模型依赖于记忆的对象可供性映射,而不是对物理属性进行推理。为了解决这一差距,我们引入了 Affordance20Q,这是一种新颖的可供性推理基准,被制定为 20 个问题游戏,且不会暴露对象的身份。在每个游戏中,模型通过询问有关隐藏对象物理属性的是/否问题,从候选集中识别隐藏对象的可供性。 Affordance20Q 包含 1,009 个游戏,涉及 454 个对象和 59 个功能可供性,所有游戏均经过手动过滤、细化和注释。我们对 15 位最先进的大语言模型进行了全面的实验,发现与人类表现相比存在很大差距(约 20 分)。基于 KL 的信息增益 (IG) 分析进一步表明,随着游戏的进展,模型无法提出有区别的问题。为了缩小差距,我们开发了知识库锚定规则归纳 (KARI),这是一种基于大语言模型的管道,可生成基于知识库 (KB) 证据的可供性规则。 KARI 将开源 LLM 提高了 15.2 分,而 KB 的有限覆盖范围阻碍了进一步的进步。我们在 https://github.com/1171-jpg/Affordance20Q.git 发布了所有代码和数据。
