论文

Math Takes Two:通信中涌现数学推理的测试

Math Takes Two: A test for emergent mathematical reasoning in communication

智能体系统Agent任务评测

摘要

尽管语言模型在数学基准上展现出卓越的熟练度,但这究竟反映真正的数学推理,还是对所学形式语法的统计模式匹配,仍不清楚。现有评估大多依赖建立在既定数学惯例之上的符号问题,限制了对模型从第一性原理构建抽象概念能力的洞察。在本工作中,我们提出Math Takes Two,一个旨在评估通过通信涌现数学推理的新基准。受人类数学认知与精确交流需求共同演化这一假说启发,我们的基准测试两个智能体在缺乏先验数学知识的情况下,能否发展出共享的符号协议来解决一个基于视觉内容的任务,其中数值系统的使用有助于外推。与许多现有数据集不同,我们的基准摒弃预定义的数学语言,转而要求智能体从零开始发现潜在结构和表示。Math Takes Two因此提供了一个新的视角,可用于开发和评估具有涌现数值推理能力的模型。

Math Takes Two:通信中涌现数学推理的测试:论文配图
图 1:Math Takes Two 基准概述。 (a) 说话者收到一个单独或以 m×nm\times n 数组形式描述基本对象集合的图像,并向听者传达一个符号字符串,听者必须从候选集中识别出正确的目标图像。在预处理阶段,代理可以自由交互并双向通信。 (b) Math Takes Two 基准中设置的示例输入图像和问题。 (c) 在练习和测试阶段,智能体会遇到具有新颖对象类型和数量比以前看到的更多的示例。只有一张候选图像是正确的。符号消息的长度和词汇相同。