论文
多智能体自动化研究系统的描述词汇
A Vocabulary for Multi-Agent Automated Research Systems
摘要
我们为基于一个或多个智能体构建的自动化研究系统引入一套描述词汇,使其设计选择更易描述与比较。该词汇规定了:1)智能体是谁;2)系统中有哪些可用操作;3)谁可以调用这些操作;4)智能体之间如何通信;5)运行内与运行之间哪些信息可见;6)下一步动作如何选择;7)一次运行如何开始;8)输出如何评估。轨迹记录从输入任务到返回产物的一次运行。由于智能体、操作与初始化可能是随机的,同一任务的重复运行会诱导轨迹的分布而非单一行为。我们的词汇将结构性设计问题——例如何时让智能体通信、获得或失去某种能力、或在运行间传递信息——转化为可检验的选择。它还将评估器纳入系统组件之中,因为报告的收益取决于代理分数与真实质量的接近程度。这一区分还将“这些系统缺乏品味”的模糊抱怨拆分为两个解法不同的失效模式。生成性品味是系统在观察到任何分数之前提出新颖轨迹的速率,而评估性品味是代理分数与其应匹配的质量之间的差距。我们在近期的自动研究系统上实例化该词汇,说明它能涵盖结构差异巨大的各种设计。