论文

科学推理的马拉松:科学智能体对多轮交互中扰动的鲁棒性

The Marathon of Scientific Reasoning: Robustness of Scientific Agents to Perturbations in Multi-Turn Interactions

智能体系统Agent任务评测

摘要

基于大语言模型(LLM)的科学Agent越来越多地用于解决科学问题,但它们对多轮交互过程中出现的缺陷的鲁棒性仍然知之甚少。我们引入 \textsc{SciARP} (Scientific Agent Robustness to Perturbations),这是在多轮问题解决过程中在科学合理的扰动下评估科学主体的基准。 \textsc{SciARP} 将 620 个科学问题转化为 3--13 个回合的相互依赖的任务,并定义了 13 种扰动类型,涵盖问题理解、证据处理、推理和结论形成。每个任务的干净版本和扰动版本在匹配的设置下独立执行,生成配对的实时轨迹,用于评估任务成功和过程可靠性。来自四个模型系列的八个LLM的实验揭示了三个关键的鲁棒性特征。首先,不同类别的科学扰动表现出不同的鲁棒性特征,并且可以将任务进展与科学可靠性脱钩:即使在信息或推理变得不可靠之后,Agent也可以继续完成任务。其次,更强的清理任务性能并不一定意味着更强的鲁棒性,因为具有更高清理任务精度的模型在扰动下可能表现出更大的退化。第三,扰动效应表现出强大的时间动态:它们可能在出现之前保持潜伏多个回合,然后通过下游依赖关系传播。总之,这些发现表明,当前的科学Agent对于科学上合理的扰动仍然不够稳健,故障往往未被发现、传播并阻碍恢复。