论文
人工智能科学家可以在运行时进行协调吗?
Can AI Scientists Coordinate at Runtime?
摘要
多智能体人工智能科学家已经证明,它可以提高各种任务的性能。然而,一种常见的方法是设计时 Agentic 编排,它通常依赖于固定的工作流程。相比之下,人类科学家在运行时协调和调整他们的分工。因此我们要问:人工智能科学家也可以在运行时进行协调吗?为此,我们引入了运行时Agent协调(RAC),它在执行过程中从现有的人工智能科学家主机中选择Agent,分配范围内的工作合同,并提供基于工件的验证。验证会通知后续Agent,而不会阻止转换或丢弃工件。我们在 ResearchClawBench 上对 Agent Laboratory、EvoScientist 和 ARK 进行单种子探索性评估,在主机校准预算下保留主机模型、工具和权限。四个累积条件将本机执行、运行时通信、运行时选择以及合约和验证的组合相加分开。运行时选择会产生每个主机观察到的最高平均分数;添加合约和验证可以减少这些手段,并产生相对于本机执行而言依赖于主机的结果。这些结果激发了运行时协调,同时暴露了预算有限下额外协调机制的局限性。代码可在 https://github.com/systemind-team/Runtime-AI-Scientist. 获取