论文
VESTA:基于统计工具智能体的可视化探索
VESTA: Visual Exploration with Statistical Tool Agents
摘要
用定量模型拟合数据是科学工作流的核心步骤,却仍是自动化程度最低的环节之一。近期的智能体系统利用语言与视觉-语言模型(VLM)迭代地提出并改进统计模型,但这些系统在更具挑战性的建模任务上表现不佳。为解决这些局限,我们提出VESTA:基于统计工具智能体的可视化探索,该框架为VLM配备一个动态增长的探索工具箱,通过数据变换、假设驱动的可视化和稳健统计检验来引导模型改进。与仅依赖迭代批评的先前系统不同,VESTA通过选择或创建诊断工具在改进之前和期间主动探索数据,这些工具会在模型上下文中累积并可在后续复用。我们在三种工具箱配置下将VESTA与既有基线对比评估:无工具、静态专家编写工具和动态模型自写工具。为支持该评估,我们提出DAWN(面向自动化工作流与数值建模的数据集),一个针对分布拟合与时间序列建模的基准,设有不同难度层级,最终涵盖真实天文学任务,包括初始质量函数与引力波啁啾信号建模。我们发现VESTA的动态工具创建优于先前的智能体流水线,在复杂和领域特定任务上增益最大。我们进一步表明,动态生成的工具比现有视觉工具创建系统产出的工具精巧得多,每个函数覆盖更多诊断类别,并强烈偏好VLM评审者能够直接推理的视觉输出。
