论文
Ambig-DS:数据科学智能体的任务框定歧义基准
Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents
摘要
随着数据科学智能体从副驾驶转向自动驾驶,静默的框定错误成为关键失效模式。智能体悄然选定看似合理却偏离意图的任务框定,产出整洁、可执行的成果物,从而掩盖其对任务的错误理解。现有基准只给流水线能否运行打分,忽略了智能体是否意识到任务本身欠规约。我们提出Ambig-DS,两个诊断套件:一个针对预测目标歧义(Ambig-DS-Target,基于表格建模基准DSBench构建的51个任务),另一个针对评估目标歧义(Ambig-DS-Objective,基于Kaggle式机器学习竞赛基准MLE-bench构建的61个任务),其构建方式使评分沿用各源基准原有的评估器。对每个任务,我们将完全规约的原始版本与经受控编辑产生的歧义变体配对;一条人工与LLM结合的验证流水线确认每个变体都容许多种貌似合理的解释,且不同解释会带来影响决策的后果。两个套件独立分析,歧义在两者中均降低性能。在横跨高效型到前沿级的五个智能体上,我们在受控诊断设定中发现:(i)失败是静默承诺:在Target上提交错误目标,在Objective上提交错误指标或不置可否的基线提交,而非执行错误;(ii)在理想化条件下,允许智能体提出一个澄清问题即可挽回大部分损失,表明缺失的框定信息驱动了观测退化中的相当一部分;但(iii)智能体无法可靠判断何时使用它:宽松提示导致在清晰任务上过度提问,而保守提示导致在歧义任务上静默采用默认。识别目标与评估目标的欠规约、而非流水线执行,才是标准数据科学智能体评测所缺失的瓶颈。
