论文

无干净参照的Agentic数据清洗:能力与权衡的实验研究

Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities and Trade-offs

摘要

没有可信干净参照的数据清洗颇具挑战,因为异常值既可能是真正的错误,也可能是有效观测。本文研究不同智能体能力如何影响无参照数据清洗,并提出一个证据落地框架,结合结构化上下文、数据剖析、LLM推理、可执行检查、受控证据检索、来源排序、引用对齐、保守修复、可逆脚本与溯源日志。研究在金融、临床与环境监测数据集上,使用受控合成污染与原始数据描述性分析,评估七种配置,共完成126次运行。评估包括两个对照基线和一个渐进式LLM序列,依次加入可执行工具、证据检索、证据控制与保守修复。在合成评估中,确定性数据剖析基线取得最高的检测F1分数0.561;在LLM配置中,完整保守配置取得最高的F1分数0.421,但没有一种配置在所有评估标准上都最佳。来源排序配置取得最低的无依据规则率,而决策级引用对齐仍然薄弱。完整保守配置未产生任何不安全或不必要的修改,尽管在加入保守策略之前这些比率已为零,且它未执行任何直接修复。总体而言,结果表明额外能力在检测、修复、证据落地、保守行为、可复现性与运营成本之间引入权衡,而非带来一致改进。该研究为在无参照Agentic数据清洗中评估这些权衡提供了结构化框架与实证方法。

无干净参照的Agentic数据清洗:能力与权衡的实验研究:论文配图
图1:证据支撑的智能体式数据清洗框架的架构。