论文

面向智能体数据科学的合理性检查

Sanity Checks for Agentic Data Science

模型评测评测方法与指标

摘要

智能体数据科学(ADS)流水线在能力与采用度上都迅速增长,OpenAI Codex等系统已能直接分析数据集并给出统计问题的答案。然而,这些系统可能得出虚假乐观、用户难以察觉的结论。为解决这一问题,我们基于真实性数据科学的可预测性-可计算性-稳定性(PCS)框架,提出一对轻量级的合理性检查。这些检查用合理的扰动来筛查智能体能否可靠地区分信号与噪声,充当一种可证伪性约束,能够揭示肯定性结论缺乏支撑。两个检查共同刻画ADS输出的可信度,例如它是找到了稳定信号,还是在响应噪声,或对输入的偶然方面敏感。我们在信噪比受控的合成数据上验证该方法,确认合理性检查能跟踪真实信号强度。随后我们在11个真实数据集上用OpenAI Codex演示这些检查,刻画每个结论的可信度,发现其中6个数据集上的肯定性结论并未得到充分支持,即使单次ADS运行可能给出支持。我们进一步分析ADS系统的失败模式,发现ADS自报告的置信度与其结论的经验稳定性校准很差。

面向智能体数据科学的合理性检查:论文配图
图 1:计算 PCS 健全性检查的管道。用户提供数据集和问题。然后,管道在零定义扰动和 PCS 扰动下生成这些扰动变体。编码代理独立地分析每个,产生零响应分布和替代响应分布。然后,引导测试和重叠系数会告知代理是否找到了基于数据的稳定的肯定结论。