论文
ISA-Bench:跨指令集架构的计算推理基准
ISA-Bench: A Benchmark for Computational Reasoning Across Instruction Set Architectures
摘要
大语言模型代码生成基准主要评估 Python、Java 等训练数据充足的资源丰富语言,对模型在不熟悉计算模型中的推理提供的证据有限:例如从单条减法指令推导算术、在通信节点间协调并行程序,或将逻辑门连接成电路。我们提出 ISA-Bench,一个由受限指令集编程游戏构成的基准。针对每个游戏我们提供完整的执行栈(解析器、虚拟机和验证器),支持带结构化反馈的自动化评估以进行迭代改进。推理模型比代码专用模型和通用模型取得更高的平均解决率,但不熟悉的语法仍是失败的主要来源。迭代反馈能让模型解决更多任务,但增益在不同架构间差异很大。我们提出推理-执行鸿沟(REG)分析,揭示了一种反复出现的脱节:识别出看似合理的计算策略,与把它表达为目标指令集架构中的正确程序之间并不一致。代码已开源。
