论文
应用手册上的任务:揭示语言模型的长期程序推理中的差距
Tasks over Application Manuals: Revealing Gaps in Long-Horizon Procedural Reasoning for Language Models
摘要
大型语言模型 (LLM) 在各种自然语言任务上都取得了出色的性能,最近的基准测试表明它们越来越擅长多跳推理。然而,这些基准通常是短期的,只需要少量的检索或推理步骤,并且为现实世界的任务提供有限的可靠性证据,这些任务涉及遵循长达数百页的复杂、相互依赖的指南手册。在本文中,我们介绍了基于应用程序手册的任务(TAM),这是评估长期程序推理的基准。我们通过策划来自两个领域的现实世界任务来构建 TAM:ICD-10-CM 临床编码(将医疗状况映射到诊断代码)和美国联邦量刑(计算犯罪量刑指南结果,特别是犯罪级别),并带有经过人类验证的标签。每项任务都需要遵循包含数万条规则的权威手册,并在不同部分执行一系列相互依赖的步骤,以得出准确的答案。我们评估通用提示方法,包括检索增强生成、ReAct 式提示和 GPT-5 上的代理Harness基线,发现最佳精确匹配性能仍然极低:ICD-10-CM 编码为 1%,量刑任务为 15.5%。这些结果表明,当前的基准可能高估了大语言模型的推理能力,并错过了一个关键挑战:可靠地遵循漫长的、基于规则的程序。完整的 TAM 数据和代码是公开的。