论文

CresOWLve:对现实世界知识的创造性问题解决进行基准测试

CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge

模型评测基准与评测资源

摘要

创造性地解决问题需要结合多种认知能力,包括逻辑推理、横向思维、类比和常识知识,以发现将看似不相关的信息联系起来的见解。然而,大多数现有的 大语言模型 (LLM) 基准仅评估此过程的特定组件。此外,许多以创造力为导向的基准依赖于人为构建的脑筋急转弯或人为场景,这些场景不能反映现实世界中创造性解决问题的方式。为了弥补这一差距,我们引入了 CresOWLve(包含五个难度级别的 2,061 个示例),这是一个评估使用基于现实世界知识的谜题创造性解决问题的基准。 CresOWLve 中的问题需要采用多种创造性思维策略,从不同领域检索事实,并创造性地组合它们以得出解决方案。通过评估几个前沿的非思考型和思考型 LLM,我们发现 CresOWLve 仍然具有很高的挑战性。我们的分析揭示了一致的性能差距:模型在事实问题上的表现比在创造性问题上的表现要好得多(下降高达 -17%)。虽然模型通常可以检索相关知识,但它们很难形成整合知识并得出正确答案所需的不明显的创造性联系。