论文

CreativityBench:通过基于可供性的工具改用评估智能体创造性推理

CreativityBench: Evaluating Agent Creative Reasoning via Affordance-Based Tool Repurposing

模型评测模型能力评测

摘要

大语言模型的最新进展使其在推理与环境交互任务上表现强劲,但其创造性问题解决能力仍缺乏充分研究。我们通过创造性工具使用的视角研究这一能力,即模型通过推理物体的可供性(affordance)与属性来改用手头物体,而非依赖其惯常用途。作为第一步,我们提出CreativityBench,一个用于评估LLM基于可供性的创造力的基准。为此,我们构建了一个大规模可供性知识库(KB),包含4K实体与150K+可供性标注,显式关联物体、部件、属性与可执行用途。在此知识库之上,我们生成14K个接地(grounded)任务,要求在约束条件下识别非显而易见但物理上合理的解决方案。对10个最先进LLM(包括闭源与开源模型)的评估显示,模型往往能选出看似合理的物体,却无法识别正确的部件、其可供性以及解决任务所需的底层物理机制,导致性能显著下降。此外,模型规模扩展带来的提升很快饱和,强大的通用推理并不能可靠地转化为创造性的可供性发现,而思维链(CoT)等常见推理时策略带来的收益有限。这些结果表明,创造性工具使用对当前模型仍是一项重大挑战,而CreativityBench为研究这一缺失的智能维度提供了有用的试验场,并对未来智能体的规划与推理模块具有潜在意义。

CreativityBench:通过基于可供性的工具改用评估智能体创造性推理:论文配图
图1:将创造性工具使用定义为基于可供性的工具再利用:约束下模型通过识别并利用替代物品的可供性来完成任务。