论文

面向智能体数据分析的无监督技能发现

Unsupervised Skill Discovery for Agentic Data Analysis

智能体系统Agent Skills

摘要

推理时技能增强提供了一种轻量级的方法,通过注入可重用的程序知识而无需更新模型参数来改进数据分析代理。然而,发现有效的数据分析技能仍然具有挑战性,因为可靠的监督成本高昂,而且不同分析格式的成功标准各不相同。这就提出了一个关键问题:如何仅通过未标记的探索来发现可重用的数据分析技能。我们提出了 DataCOPE,一种用于数据分析代理的无监督验证者引导的技能发现框架。 DataCOPE 从探索轨迹中获取验证器信号,并使用它们来表征轨迹之间的相对质量或一致性。它迭代地协调用于轨迹生成的数据分析代理、用于信号提取的无监督验证器以及用于对比技能蒸馏的技能管理器。对于报告式分析,我们将验证器实例化为自适应检查表验证器,它派生特定于任务的标准,通过可验证的覆盖范围对报告进行评分,并迭代地细化检查表。对于推理式分析,我们将其实例化为答案一致性验证器,该验证器根据答案一致性对轨迹进行分组,并使用自洽性作为辅助信号。我们根据 Deep Data Research 的报告式分析和 DABStep 的推理式分析来评估 DataCOPE。在这两种设置中,DataCOPE 始终比基线提高了保留性能。对四种模型设置进行平均后,DataCOPE 在报告式和推理式任务上的平均得分分别提高了 9.71% 和 32.30%。

面向智能体数据分析的无监督技能发现:论文配图
图 2:DataCOPE 框架概述。数据分析代理从当前技能下的未标记探索集中采样轨迹,而无监督验证者则在没有黄金答案或任务成功标签的情况下导出信号并对轨迹进行分组。技能管理器对比分组的轨迹,以提炼可重用的过程并迭代地创建或更新技能。对于报告类型的任务,自适应检查表验证程序使用特定于任务的检查表对报告进行评分并完善报告和检查表生成技能;对于推理型任务,答案一致性验证器会聚集最终答案并估计自我一致性以指导技能改进。