论文
PetriBench:动态状态空间上 LLM 推理的基准测试
PetriBench: Benchmarking LLM Reasoning over Dynamic State Spaces
摘要
描述 LLM 推理的特征仍然是一个开放的挑战,因为许多现有的基准测试孤立特定的推理技能,依赖外部知识,或者扩展成本高昂。我们介绍 PetriBench,这是一个紧凑、完全独立且可扩展的基准,用于使用 Petri 网评估动态状态空间上的 LLM 推理,Petri 网是一种用于对现实世界并发和分布式系统进行建模的成熟形式主义。 PetriBench 将推理组织为四个任务族,其范围和时间范围各不相同,通过增加结构复杂性生成简单、中等和困难级别,并根据准确的地面事实进行评估。在各种专有和开放权重模型中,准确性随着难度的增加而不断降低,而更困难的实例则暴露出越来越独特的特定于任务的能力配置文件。其他分析表明,测试时计算可提高性能,但与不同推理任务的交互方式不同,并且程序生成可实现结构复杂性的平滑扩展。总之,这些结果表明 PetriBench 为探索 LLM 推理的优势、局限性和扩展行为提供了统一且可扩展的设置。