技术实践
Snowflake研究团队构建DARE-Bench与PRISM-DS训练可靠的数据科学智能体
概述
Snowflake AI研究团队指出,真实数据科学智能体要求端到端执行、完全可复现、严格指标意识与指令遵循,而前沿模型常忽略约束、弄错顺序或漏传随机种子。症结在两个缺口:基准偏小或依赖主观评审,强化学习需要确定性程序化真值;智能体依赖通用推理而非贴合任务的设计。团队推出DARE-Bench:6300个源自Kaggle的确定性任务,带程序化真值,兼作评测与训练资源,覆盖指令遵循、ML建模与时间序列变体。前沿模型评测中Claude-Sonnet-3.7建模领先、GPT-5指令遵循领先(2025年9月数据)。可验证真值让训练可行:拒绝采样SFT把Qwen3-32B准确率提升1.83倍;GRPO做RLVR把Qwen3-4B得分从4.39提到37.40(约8倍),代码错误减少48%。设计侧PRISM-DS用任务画像到技能的循环:先提取数据模态、指标等特征,再从1504篇Kaggle获奖笔记蒸馏的4421条技能库中检索指导生成;以GPT-5为骨干在建模子集得48.38分,高于MLE-STAR(44.24)等基线(2025年3月数据)。DARE-Bench及训练资源已发布。