论文
Spatial Atlas:面向空间感知研究智能体基准的计算支撑推理
Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks
摘要
我们提出计算支撑推理(compute-grounded reasoning, CGR),这是一种面向空间感知研究型智能体的设计范式:每个可回答的子问题都先由确定性计算解决,然后才要求语言模型生成。Spatial Atlas将CGR实例化为一个单一的Agent-to-Agent(A2A)服务器,负责处理两个具有挑战性的基准:FieldWorkArena——一个覆盖工厂、仓库与零售环境的多模态空间问答基准;以及MLE-Bench——一套需要端到端机器学习工程的75个Kaggle机器学习竞赛。结构化空间场景图引擎从视觉描述中抽取实体与关系,确定性地计算距离与安全违规,然后将计算所得事实提供给大语言模型,从而避免幻觉式的空间推理。熵引导的动作选择最大化每一步的信息增益,并在三级前沿模型栈(OpenAI + Anthropic)之间路由查询。具备策略感知代码生成的自愈式ML流水线、分数驱动的迭代精炼循环,以及基于提示的数据泄露审计登记簿,共同补全了该系统。我们在两个基准上进行评估,结果表明CGR在取得有竞争力的准确率的同时,通过结构化中间表示与确定性空间计算保持了可解释性。