论文

ISA-Bench:跨指令集架构的计算推理基准

ISA-Bench: A Benchmark for Computational Reasoning Across Instruction Set Architectures

模型评测基准与评测资源

摘要

大语言模型代码生成基准主要评估 Python、Java 等训练数据充足的资源丰富语言,对模型在不熟悉计算模型中的推理提供的证据有限:例如从单条减法指令推导算术、在通信节点间协调并行程序,或将逻辑门连接成电路。我们提出 ISA-Bench,一个由受限指令集编程游戏构成的基准。针对每个游戏我们提供完整的执行栈(解析器、虚拟机和验证器),支持带结构化反馈的自动化评估以进行迭代改进。推理模型比代码专用模型和通用模型取得更高的平均解决率,但不熟悉的语法仍是失败的主要来源。迭代反馈能让模型解决更多任务,但增益在不同架构间差异很大。我们提出推理-执行鸿沟(REG)分析,揭示了一种反复出现的脱节:识别出看似合理的计算策略,与把它表达为目标指令集架构中的正确程序之间并不一致。代码已开源。

ISA-Bench:跨指令集架构的计算推理基准:论文配图
图 1:五个 ISA-Bench 环境概览。每个面板展示一个游戏对应的计算模型、示例任务或代码片段,以及任务范围。这些环境从单指令机器(SIC-1,即便做加法也需要基于“减法即跳转”的多步推导)出发,经过结构逐渐增强的顺序架构(HRM 带传送带 I/O 的累加器;TIS-100 带阻塞式节点间通信的并行节点网格),再到声明式设计(MHRD 从单个 NAND 原语出发的组合式电路连线)与空间输出生成(BOX-256 的内存映射像素显示)。这一递进检验了各种计算原语:代数推导、顺序规划、并行协调、结构组合与空间推理。