论文
DataCross:面向跨模态异构数据分析的统一基准与智能体框架
DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis
摘要
在真实世界的数据科学和企业决策中,关键信息常碎片化分布于可直接查询的结构化数据源(如SQL、CSV)和被锁定在非结构化视觉文档(如扫描报告、发票图像)中的“僵尸数据”里。现有数据分析智能体主要局限于处理结构化数据,未能激活并关联这些高价值视觉信息,与工业需求形成显著差距。为弥合这一差距,我们提出DataCross,一个用于跨异构数据模态统一、洞察驱动分析的新型基准与协作智能体框架。DataCrossBench包含200个跨金融、医疗等领域的端到端分析任务。它通过人在环的逆合成流水线构建,确保真实的复杂性、跨源依赖和可验证的真值。该基准将任务分为三个难度层级,以评估智能体在视觉表格抽取、跨模态对齐和多步联合推理方面的能力。我们还提出受人类分析师“分而治之”工作流启发的DataCrossAgent框架。它采用专门化子智能体,每个都是特定数据源的专家,通过源内深度探索、关键源识别和上下文交叉授粉的结构化工作流进行协调。新颖的reReAct机制为事实验证提供稳健的代码生成和调试。实验结果表明,DataCrossAgent在事实性上较GPT-4o提升29.7%,并在高难度任务上展现出更优的鲁棒性,有效激活碎片化的“僵尸数据”以进行富有洞察力的跨模态分析。
