论文

在机器人化学实验室中对大语言模型智能体进行压力测试

Stress-testing large language model agents in a robotic chemistry laboratory

智能体系统Agent任务评测

摘要

AI通常通过知识、推理和计划生成来评估,而科学智能(scientific agency)需要可靠的物理行动和对证据的适应。在此,我们用机器人化学实验室作为物理世界测试床,使科学智能可被度量。其45个以机器可读技能形式暴露的模块化工作站使4,608次试验成为可能。在实验室约束下,只有3.3%的试验产出了经专家评估可执行的工作流;即便最好的系统也只达到28.1%。长程规划仍是挑战:只有三个可执行工作流超过30个操作,尽管最长的包含44个操作。在五轮实验中,实验反馈促成了局部调整,但没有出现工作流级别的重新规划或分析方法的重设计。通过使物理可执行性与证据驱动的重新规划可度量,我们的研究提供了对部署就绪度的基于证据的评估,以及一个诊断框架,用于引导通向物理扎根自主研究的闭环改进。