论文

MIRA-Math:最小信息请求与数学推理的基准

MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning

模型评测基准与评测资源

摘要

数学推理基准通常提供解每题所需的全部事实,而交互式基准常把推理与工具、检索和长程对话混在一起。我们引入MIRA-Math:面向更窄诊断能力的基准——求解其完整潜在状态有唯一答案、但求解者视图恰好缺失一个必要原子事实的数学问题。求解者必须在严格预算下用自然语言请求缺失信息,然后把返回的事实整合进精确的最终答案。固定的受约束LLM响应者只看到数据集提供的原子事实,须在请求匹配时提供引用事实、否则拒绝。因此实例生成、类型化提示规格、验证与最终答案验证都是确定性的,而请求度量在固定的LLM中介响应者通道下测量。MIRA-Math含来自22个类型化数学族的2,310个生成实例——横跨代数、概率、线性系统、离散结构、信号处理、马尔可夫链、电路、插值与数值边值问题。跨前沿与小模型的实验显示:请求成功与最终答案准确率可分离——模型可能问对事实却在下游计算失败,或在获得规范提示前就失败。我们发布生成器、验证器、提示、运行元数据与数据集文档,支持数学推理中最小信息请求的可复现评估。

MIRA-Math:最小信息请求与数学推理的基准:论文配图
图 1:MIRA-Math 协议概述,以成功的 Circuit_missing_resistance 跟踪进行说明。代理 A 收到隐藏了一个原子事实的私有视图,请求自然语言中缺失的位置,并从只能看到其私有约束的固定约束信息持有者接收结构化报价或拒绝。收到提示后,Agent A 仍必须计算最终答案并通过家庭特定的精确验证器。