论文

Absurd World:一种探测LLM推理能力的简单而强大的现实荒诞化方法

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

模型评测基准与评测资源

摘要

尽管大语言模型(LLM)在各类任务上极其强大且多面,其思考能力仍常被置于审视之下,因为它们有时无法解决人类能系统化解决的问题。然而,近期文献聚焦于用日益复杂的问题击破LLM推理,而LLM在简单逻辑推理上是否稳健仍缺乏探索。本文提出Absurd World这一基准测试框架,在被改变的现实设定下测试LLM,其中场景在逻辑上自洽,人类可以轻松解决这些任务。Absurd World将现实世界模型分解为符号、动作、序列和事件,并自动加以改变,从而创造出求解逻辑保持不变的荒诞世界。该框架用简单和高级提示技术评估了大量模型,并证明它是判定LLM逻辑思考能力、剥离其从现实世界学到的模式的有效工具。研究者可以利用该框架针对某个现实世界问题对LLM进行广泛测试,以验证其推理能力对任务变体是否稳健。

Absurd World:一种探测LLM推理能力的简单而强大的现实荒诞化方法:论文配图
图1:Absurd World总览:真实任务被分解为符号组件、系统扰动后转换成荒诞世界,用于压力测试泛化能力。