论文

英雄之旅:用文本游戏测试复杂的规则归纳

HERO'S JOURNEY: Testing Complex Rule Induction with Text Games

模型评测基准与评测资源

摘要

我们引入了 HERO'S JOURNEY,这是目标导向的情景任务中规则归纳的基准,其中代理必须从演示中推断隐藏规则,并通过多步骤执行对其采取行动。 《英雄之旅》涵盖了跨属性和程序归纳系列的八个任务,每个任务都有四种结构规则形式、可控词汇基础和可识别性条件。通过评估最先进的 LLM,我们发现模型显示了规则归纳的证据,但能力有限且跨任务不均匀。同时,流程执行增加了模型的执行瓶颈,而表面语义的影响很小。特定于归纳的转向方法提高了属性任务的性能,但在程序任务上没有显示出可靠的收益,这表明程序归纳的差距仍然是一个开放的挑战。