论文
Bioinfoysis技术报告
Bioinfoysis Technical Report
摘要
大语言模型代理在生物信息学中显示出了前景,但大多数现有系统主要侧重于生成最终答案,将规划、工具使用和代码执行视为瞬态交互。这种设计不太适合长期生物信息学任务,其中结论必须与支持它们的数据、计算和中间证据保持联系。我们引入了 \textbf{Bioinfoysis},这是一种多代理工具,它将每个请求表示为持久的、基于工件的分析运行。 Bioinfoysis 将全局规划与逐步的、证据驱动的重新规划相结合:规划器维护一个可执行的清单,并使用每次工作执行后返回的结构化移交来修改待处理的步骤。这些交接将中间结果与其负责的代理、检查表步骤和计划生成绑定在一起,从而防止过时的证据在重新计划后被悄悄地重用。受控的运行时会在生成的脚本、表格和图形用于下游分析或报告之前对其进行验证,而特定于角色的上下文、持久内存和受控生物信息学技能则支持长期分析轨迹的可靠执行。我们在 BixBench 和 LAB-Bench 2 的两个问答轨道上评估 Bioinfoysis。在 BixBench 上,Bioinfoysis 达到了 82.4% 的最先进准确率。在四种底层语言模型中,Bioinfoysis 将 SeqQA2 上的平均准确度从 27.81% 提高到 64.13%,将 DbQA2 上的平均准确度从 3.13% 提高到 31.25%。这些结果表明,可靠的生物信息学自动化不仅取决于模型能力,还取决于管理规划、执行、内存和证据流的工具。我们希望Bioinfoysis的出现能够对生物信息学界的发展起到驱动和引领作用。我们的演示网站可以在 https://report.bioinfoysis.com/ 中看到。