论文

辨别:人工智能Agent可以像科学家一样工作并指导发现吗?

DISCERN: Can AI Agents Work Like Scientists and Guide Discovery?

智能体系统Agent任务评测

摘要

可靠的自动化研究需要Agent审查数据、验证分析并生成基于可靠证据的假设,这可能会减少常规科学工作量,同时使科学家能够专注于解释和发现。现有的基准通常仅单独评估分析任务的完成情况或假设的生成,而不是测试可靠的证据是否支持有效和新颖的主张。我们引入了 DISCERN(数据完整性和科学能力:证据、推理和新颖性),这是一个针对真实、公开可用数据集的受控基准,用于评估自动化研究工作流程的三个关键级别。前两个级别测试混杂和工具陷阱下的数据完整性和分析验证,而第三个级别测试对抗性审查下的假设生成和修正,包括反事实案例,其中与真实数据一致的证据和记录的科学现象与既定期望相冲突,激发替代解释和可检验的假设。 DISCERN 在 203 项任务、8 个生命科学轨道和 8 个模型中表明,强大的总体表现可以掩盖特定级别的弱点。智能体在 1 级、2 级和 3 级评估中仅 60.8%、34.2% 和 0.6% 获得满分,处罚归因于拒绝合理数据、未能将公认的局限性带入结论以及假设产生的巨大差异。通过词元和代码使用进行的跨跟踪排名比通过证据判断进行的排名要稳定得多,这表明计算工作比基于证据的推理具有更大的一致性。这些概况确定了监督科学援助的机会,但目前的Agent尚未证明可靠的自主分析或发现。代码和数据:https://huggingface.co/datasets/discern-bench-anon/discern-benchmark