论文

GAGR-Lab:联合评测空间几何与解析函数推理

GAGR-Lab: Evaluating Joint Spatial-Geometric and Analytic Function Reasoning

模型评测应用与实践基准与评测资源视觉感知与空间理解

摘要

联合空间几何和解析函数推理需要将感知的空间配置转换为符号函数,其执行的曲线满足几何约束。我们提出了 GAGR-Lab,一个通过笛卡尔游戏场景、显式函数语义和权威 Rust 轨迹执行来衡量这种能力的框架。它区分了空间感知、度量基础、几何关系、函数解释、函数构造和约束综合。我们指定了四个可配置的场景难度预设和预期的 24 单元诊断设计,同时仅报告实际评估的子集。使用两个 API 凭证作为执行副本的一个托管模型 (Llama 3.2 11B Vision Instruct) 的有界试点产生了 72 个平衡游戏,其中有 432 次尝试、429 个有效的提供者响应,并且没有目标命中;探索性的普通功能提示变体也无法命中,而结构化本地化界面则不会产生可评分的输出。特权分析搜索控制可独立成功处理来自 300 个生成场景的 600 个方向案例,具有精确的可重复性和 1,200 次成功的垂直反射或平移检查。该框架将服务可靠性、符号合规性和几何成功分开,并保留精确的模型可见输入和实现路径。分阶段协议概述了诊断校准、保留复制、多模型比较和配对稳健性测试。该贡献是一个运营研究框架,其中包含已执行的试点和明确确定的前瞻性研究计划;完整的难度矩阵和比较模型结果尚未经过测试。