论文
大声失败:Agentic 数据分析的可审核运行时
Fail Loudly: An Auditable Runtime for Agentic Data Analysis
摘要
大语言模型 (LLM) 使数据科学Agent能够自动对异构文件进行多步骤分析。然而,有关数据源、范围或统计定义的错误选择通常会导致无声错误:计算成功执行,但产生看似合理但不正确的输出,无法回答预期的问题。为了缓解这个问题,我们提出了 RADAR,这是一个可审计的运行时,它使Agent的分析选择可以检查,并通过执行反馈支持其修改。 RADAR 通过三个核心机制运行。首先,证据保存探索模块检索与任务相关的内容,同时保留源位置和观察范围。接下来,运行时使用类型化运算符来记录Agent的声明输入、操作参数和结果观察。最后,运行时验证根据这些观察结果检查建议的操作。当检测到冲突时,运行时会拒绝操作或提供诊断反馈,从而允许Agent在错误传播之前修改其选择。这种设计使Agent能够大声失败,同时将语义解释留给LLM。在 KramaBench 上,RADAR 在完整源检索的情况下获得了 0.723 的总分,在提供黄金源的情况下获得了 0.747 的总分,相对于最强基线分别提高了 35.9% 和 28.8%。除了 KramaBench 之外,RADAR 在 DA-Code 上实现了 14.0% 的相对性能提升,在 DABStep 上实现了 59.3% 的相对性能提升,证明了其在各种 agentic 数据分析工作流程中的适用性。