论文
DataSense-Bench:迈向人工智能科学家的第一步
DataSense-Bench: The First Step Toward an AI Scientist
摘要
随着有关递归自我改进(RSI)和通用人工智能(AGI)的说法激增,我们提出一个简单的问题:前沿人工智能模型是否具有数据感知能力,即它们能否可靠地选择正确的数据进行训练?我们引入DataSense-Bench,通过机器学习中数据选择和性能预测的基本问题来研究这种能力。我们要求 AI 代理选择候选训练子集并对其进行排名,这些子集可用于微调小型 LLM 模型。代理可以检查数据、编写和执行分析代码以及运行模型前向传播,但不能训练模型或访问实际的评估任务。然后,我们对每个选定子集的基本模型进行微调,并在标准化协议下评估其训练后性能。我们实例化了终端问题解决和工具使用的基准,从 OpenThoughts-Agent 和 EnvScaler 中选择轨迹,并分别在 TBLite 和 BFCL 上进行评估。然后,我们沿着两个互补的维度评估智能体:排名靠前的智能体的训练后表现 子集,反映识别高价值训练数据的能力,而排名准确性,反映预测所选子集相对性能的能力。在我们的实验中,相对于随机选择的选择增益是有限的;代理无法可靠地对他们选择的组进行排名,并且排名能力在不同任务中并不一致:Astra 在所有三个工具使用运行中识别出最佳组,但仅在三个终端运行之一中识别出最佳组。对这两项任务的执行轨迹的分析表明,代理经常使用相似的数据信号,但以不同的方式解释其训练价值。